pdfhelp.ru Все инструменты Инструкции
Без регистрации. Серверы и обработка данных — в России

Как извлечь текст из PDF

Нужен только текст документа, без вёрстки и картинок? Сохраните PDF в файл TXT — это быстрее и чище, чем копировать страницы вручную.

Что нужно сделать сегодня?

Обновлено 25.09.2026

Инструмент «PDF в TXT» работает прямо в браузере: файл не загружается на сервер, поэтому так можно обрабатывать и личные документы. Результат — обычный текстовый файл, который открывается в любом редакторе, на компьютере и на телефоне.

Когда это удобно

  • нужно перенести текст договора или статьи в другую программу без лишнего форматирования;
  • требуется найти и сравнить фрагменты в нескольких документах;
  • текст пойдёт в таблицу, базу данных, переводчик или систему подготовки документов;
  • копирование со страниц даёт разрывы строк посреди предложений.

Как извлечь текст

  1. Откройте «PDF в TXT» и выберите файл.
  2. Выберите режим обработки.
  3. Скачайте готовый файл .txt.
PDF в TXTВесь текст документа в файл .txtОткрыть

Какой режим выбрать

«Абзацами (склеить строки)» — строки внутри абзаца соединяются в одну. Подходит для обычного текста: писем, договоров, статей. Такой текст удобно вставлять в Word или переводчик — он не рассыпается на короткие строки.

«Построчно, как в PDF» — каждая строка сохраняется так, как она стоит на странице. Выбирайте этот режим для списков, реквизитов, стихов, кода, а также когда важно сверять текст со страницей по строкам.

Если в режиме «Абзацами» склеилось лишнее — например, пункты списка слились в один абзац, — попробуйте построчный режим и поправьте переносы вручную.

Кодировка

Файл сохраняется в кодировке UTF-8 — это стандарт, в котором корректно хранятся русские, латинские и другие символы. Современные редакторы открывают такие файлы без проблем.

Если при открытии вместо букв видны непонятные знаки, значит, программа выбрала другую кодировку. Как правило, её можно указать при открытии или импорте файла — выберите UTF-8. Это часто требуется при импорте текста в электронные таблицы.

Если файл пустой или текста мало

Такое бывает, когда PDF — это скан или фото страниц. В таком файле нет текстового слоя: страница хранится как изображение, и извлекать нечего. Проверить просто — попробуйте выделить слово мышью: если выделяется вся страница целиком, это картинка.

Для сканов нужно распознавание текста. «Распознать скан» умеет выдавать результат сразу в TXT, а также в Word или PDF с поиском по тексту. Языки — русский, английский или оба сразу.

Распознать сканOCR: текст из скана на русскомОткрыть

Подробно о том, как подготовить скан и настроить распознавание, — в инструкции «Как распознать текст со скана».

Если текст копируется «кракозябрами»

Иногда текст в PDF есть, но при извлечении вместо букв получается набор символов. Причина — в самом файле: программа, которая его создала, не записала соответствие знаков шрифта и букв. Такой документ тоже поможет распознавание — оно работает по изображению страницы. Разбор всех причин — в статье «Почему из PDF не копируется текст».

Если нужна вёрстка

TXT хранит только текст: без шрифтов, таблиц и выделения. Если важно сохранить абзацы, таблицы и оформление, используйте PDF в Word — в режиме «Только текст» или «С сохранением вёрстки».

Другие инструкции

Другие инструменты

Из PDF

В PDF

Страницы и файлы

Оптимизация

Оформление

Защита