Кажется, что распознавание текста - это давно решённая задача. Мы фотографируем чек, страницу книги или документ, нажимаем кнопку и уже через несколько секунд получаем готовый текст. Из-за этого легко подумать, что все сервисы работают примерно одинаково.

Но стоит попробовать распознать таблицу, договор, рукописную записку или фотографию документа, сделанную немного под углом, как становится понятно, что результаты могут отличаться очень сильно. Причина в том, что сегодня под словом OCR скрываются сразу несколько совершенно разных технологий, которые работают по разным принципам и решают разные задачи.

Что вообще такое OCR?

OCR (Optical Character Recognition) - технология, которая умеет читать текст на изображениях.

Именно благодаря OCR фотография страницы книги, скан договора или снимок чека превращаются в обычный редактируемый текст.

Первые OCR системы появились ещё несколько десятилетий назад. С тех пор они постоянно развивались, но их главная задача оставалась прежней: найти символы на изображении и превратить их в текст.

И долгое время этого действительно было достаточно.

Но со временем задача стала гораздо сложнее. Вместо простых страниц с печатным текстом появились таблицы, формы, рукописные записи, фотографии документов, сделанные на телефон, и страницы со сложной вёрсткой. Стало очевидно, что одного распознавания отдельных символов уже недостаточно: теперь важно понимать сам документ, видеть его структуру и то, как связаны между собой разные элементы. Именно здесь ИИ полностью изменил подход к распознаванию текста.

Tesseract против vision-модели: тест на одном счёте

Для сравнения я взял обычный счёт с несколькими позициями.

Синтетический демонстрационный счёт с четырьмя позициями, подытогом, налогом и итоговой суммой, снятый под небольшим наклоном

Документ специально сделал синтетическим, без реальных данных. Затем немного наклонил изображение, как будто его сфотографировали телефоном, и прогнал через два разных инструмента.

  • Tesseract один из самых известных классических OCR.
  • Chandra OCR 2 современная document VLM, которую я запускал локально.

Результаты сравнения: ошибки в тексте и структура таблицы

На первый взгляд кажется, что оба инструмента справились.

Сравнение результатов распознавания одного счёта: у Tesseract ошибки и потерянная таблица, у Chandra OCR 2 структура таблицы сохранена

Но если посмотреть внимательнее, разница оказывается гораздо больше. Tesseract сделал три ошибки в тексте: заголовок INVOICEпревратился в INVOICE AY, город Springfield - в Springfieia, а позиция Extra API seats - вExtra AP seats. Суммы он при этом взял верно: 2 062.00, налог 103.10 и итог 2 165.10 совпадают с оригиналом.

Самое главное потерялось не в цифрах. Таблица из четырёх позиций схлопнулась в плоский текст: колонки Description, Qty, Unit Price и Amount слились в одну строку, и понять, какое число к какой позиции относится, по такому выводу уже нельзя.

Chandra OCR 2 решила эту задачу иначе. Вместо того чтобы просто распознавать отдельные символы, она сначала определила, что перед ней находится счёт, затем проанализировала структуру страницы, поняла, где расположен заголовок, где начинается таблица, какие строки относятся друг к другу и какие значения находятся в одной колонке, и только после этого извлекла текст. Поэтому результат оказывается значительно ближе к исходному документу.

Это хорошо показывает, что современные ИИ-модели уже не просто читают текст. Они стараются понять документ целиком, сохраняя его структуру и взаимосвязь между отдельными элементами.

Как сегодня устроено распознавание текста

Когда говорят "OCR", часто создаётся впечатление, что существует одна технология, которая постепенно становится всё лучше.

На самом деле сегодня используется сразу несколько разных подходов.

И каждый из них решает свои задачи.

Если разбираться в этих подходах не хочется, ImgTxtApp— Telegram-бот для извлечения текста из изображений — уже сочетает их в одном сценарии.

Подробнее об ImgTxtApp

1. Классический OCR

Именно с него всё начиналось.

Классический OCR работает по довольно простой схеме: сначала он находит строки текста на изображении, затем разбивает их на отдельные символы, распознаёт каждую букву и в конце собирает всё обратно в текст.

Если документ ровный, текст хорошо читается, а фотография качественная, результат обычно оказывается очень хорошим.

Но как только появляются таблицы, сложная вёрстка, фотографии под углом, тени, блики или плохое освещение, количество ошибок начинает быстро расти. Причина в том, что классический OCR практически не понимает сам документ. Для него изображение - это прежде всего набор отдельных символов, а не связанные между собой элементы страницы. Именно поэтому в сравнении выше таблица превратилась в обычный текст: буквы были распознаны, но структура документа практически исчезла.

2. Специализированные OCR

Со временем появились OCR модели, обученные для работы с конкретными типами документов. Одни лучше распознают чеки, другие счета, третьи таблицы. Есть модели, созданные специально для паспортов, водительских удостоверений, ID карт и других документов, где важно правильно извлечь определённые поля.

Поэтому сегодня не существует одной универсальной OCR модели, которая одинаково хорошо справлялась бы со всеми документами. Каждая создаётся для своей задачи. Если использовать модель именно в том сценарии, для которого она разрабатывалась, результат часто оказывается очень качественным. Но стоит дать ей документ другого типа, и качество может заметно снизиться.

3. Vision модели

Следующим этапом развития стали Vision модели.

Если классический OCR пытается распознать отдельные буквы, то Vision модель сначала анализирует страницу целиком. Она определяет, где находится заголовок, где начинается таблица, какие строки относятся друг к другу, где указана дата, а где расположена итоговая сумма, и только после этого извлекает текст. Благодаря такому подходу современные ИИ-модели значительно лучше справляются с таблицами, документами со сложной вёрсткой, фотографиями, сделанными под углом, и рукописными заметками.

ИИ научился понимать структуру документов

Следующим шагом стали модели, которые умеют не только распознавать текст, но и понимать, как устроен сам документ.

Такие модели часто называют document VLM (Document Vision Language Model).

Если обычный OCR видит набор символов, то document VLM сначала анализирует всю страницу и понимает, где находятся заголовки, таблицы, поля формы и другие элементы, а уже затем извлекает информацию.

Поэтому такие модели могут не просто вернуть текст, а сразу сохранить структуру документа. Например:

  • представить таблицу как таблицу
  • преобразовать документ в Markdown
  • вернуть данные в формате JSON
  • извлечь нужные поля из формы

Именно к таким моделям относится Chandra OCR 2, использованная в этом сравнении.

Она понимает не только текст, но и взаимное расположение элементов страницы, благодаря чему точнее сохраняет структуру исходного документа.

Что можно попробовать локально

Если хочется запускать OCR самостоятельно, сегодня существует множество открытых моделей, которые можно использовать локально без отправки документов в облако. При этом каждая из них имеет свои сильные стороны: одни лучше работают с таблицами, другие - с формами, третьи - с рукописным текстом или многостраничными документами.

МодельЛучше работает с
Chandra OCR 2Таблицы, формы, рукописный текст, формулы
PaddleOCR VLТаблицы, формы, многоязычные документы
dots.ocrСтруктурированные документы, редкие языки
DeepSeek OCRНекачественные и повёрнутые изображения
Nanonets OCR2Формы, подписи, печати, чекбоксы
LightOnOCR 1BПростые документы
Granite DoclingPDF, DOCX, изображения
Surya 2Таблицы, layout, многостраничные документы
GOT OCR 2.0Текст, формулы, ноты, отдельные области
LIFTИзвлечение полей, JSON
Qwen3 VLУниверсальные документы, анализ изображений

Что всё это значит для обычного пользователя?

Если посмотреть на развитие OCR за последние годы, становится заметно, что новые технологии не заменяют старые полностью, а дополняют их. Классический OCR остаётся быстрым и хорошо справляется с простыми документами, специализированные модели показывают лучшие результаты в своих узких сценариях, а ИИ помогает там, где важно понять структуру документа, а не просто распознать отдельные символы. Именно поэтому современные сервисы всё чаще сочетают сразу несколько подходов, чтобы одинаково уверенно работать с книгами, таблицами, чеками, договорами, рукописными заметками, PDF и фотографиями документов.

Нужно ли вообще разбираться во всех этих моделях?

Если вы разрабатываете собственную систему распознавания документов, выбор модели действительно имеет значение.

Но если ваша задача просто быстро получить текст из фотографии, PDF или скана, изучать все эти технологии совсем необязательно.

Современные сервисы уже сочетают разные технологии распознавания внутри одного решения.

Просто отправьте документ в Telegram

Если вам не хочется выбирать между OCR, специализированными моделями и ИИ, делать этого и не нужно.

ImgTxtApp сочетает современные технологии распознавания документов, поэтому вам не нужно самостоятельно выбирать подход к распознаванию.

Вы просто отправляете фотографию, скан или несколько изображений в Telegram и получаете готовый текст.

Неважно, что находится перед вами: страница книги, чек, таблица, договор или рукописная заметка.

Главная цель остаётся неизменной: просто отправить документ и получить максимально точный текст.

Попробовать ImgTxtApp