pdfhelp.ru Все инструменты Инструкции
Без регистрации. Серверы и обработка данных — в России

Почему скан распознаётся с ошибками

Распознавание читает текст по изображению страницы. Чем хуже изображение, тем больше ошибок — и большинство проблем решается ещё до распознавания.

Что нужно сделать сегодня?

Обновлено 25.09.2026

Низкое разрешение

Самая частая причина. При разрешении ниже 200 dpi буквы состоят из слишком малого числа точек: «е» путается с «с», «и» с «н», запятые теряются или превращаются в точки. Особенно страдает мелкий шрифт — сноски, реквизиты, текст таблиц.

Что делать: сканируйте с разрешением 300 dpi — это оптимум для распознавания. Больше обычно не нужно, меньше — заметно хуже. Не сжимайте скан перед распознаванием: сжатие снижает разрешение изображений.

Наклон и перевёрнутые страницы

Перевёрнутые страницы и небольшой перекос сервис исправляет сам. Но если лист сфотографирован под углом, строки получаются не только наклонными, но и искажёнными: верх страницы уже низа, буквы по краям сжаты. Такое исправить сложнее.

Что делать: при съёмке телефоном держите его параллельно листу, строго сверху.

Тени, блики и фон

Тень от руки или телефона, затемнение у переплёта, блик от вспышки на глянцевой бумаге закрывают часть букв. Цветной или неровный фон — клетка, линовка, водяные знаки бланка — тоже мешает отделить текст.

Что делать:

  • снимайте при ровном дневном свете, без вспышки;
  • книги и сшитые документы прижимайте, чтобы страница лежала ровно;
  • для текстовых документов используйте режим сканирования «оттенки серого».

Шрифт и оформление

Лучше всего распознаются обычные шрифты среднего размера. Ошибки чаще появляются в тексте:

  • очень мелком или сильно сжатом;
  • декоративном, рукописном по стилю, стилизованном под старину;
  • светлом, бледном, напечатанном на заканчивающемся картридже;
  • с перекрытием печатями, подписями, пометками ручкой.

Что делать: если есть возможность, получите более качественную копию — оригинал вместо ксерокопии, чёткий отпечаток вместо бледного.

Рукописный текст

Рукописный текст не распознаётся — распознавание рассчитано на печатный. На бланках, заполненных от руки, будет распознан только печатный текст, а рукописные вставки придётся перепечатать вручную.

Неверный язык

Распознаватель подбирает буквы из алфавита выбранного языка. Если указать «английский» для русского текста, результат будет бессмысленным. Если указать «русский» для документа с латинскими названиями, адресами почты и артикулами, они исказятся.

Что делать: для смешанных документов выбирайте «русский и английский»; для текста полностью на одном языке — этот язык.

Таблицы

Таблицы — сложный случай: распознаватель должен не только прочитать текст в ячейках, но и понять структуру. Ошибки в таблицах чаще, если линии бледные или отсутствуют, ячейки объединены, текст повёрнут.

Что делать: проверяйте таблицы после распознавания особенно внимательно. Если структура развалилась, иногда проще создать таблицу заново в Word и перенести в неё распознанный текст.

Как распознать заново

Сначала устраните причину: пересканируйте или переснимите страницы. Если страницы сфотографированы телефоном, соберите снимки в один PDF.

JPG в PDFФото и сканы в один PDFОткрыть

Затем распознайте файл, выбрав правильный язык и формат результата.

Распознать сканOCR: текст из скана на русскомОткрыть

Пошаговая инструкция с выбором формата и диапазона страниц — «Как распознать текст со скана». Советы по съёмке документов — в инструкции «Как сделать PDF из фото».

Другие инструкции

Другие инструменты

Из PDF

В PDF

Страницы и файлы

Оптимизация

Оформление

Защита