Основной путь для каждого способа

Итак, сегодня я решила проверить, какой способ на самом деле быстрее, если нужно извлечь текст из картинки и использовать его дальше.

Я взяла четыре наиболее популярных варианта и прошла каждый из них по шагам, но довольно быстро выяснилось, что само распознавание текста — это только часть процесса, потому что гораздо интереснее, что происходит до и после него.

Важно не только, где сейчас находится картинка, но и нужно ли ее сначала сохранять или переносить на другое устройство, сколько действий потребуется до готового текста и что потом с этим текстом делать.

Поэтому в этот раз я решила сравнивать не функции конкретных сервисов, а именно путь от исходной картинки до готового редактируемого текста.

Если говорить совсем коротко, выбор способа во многом зависит от того, где находится исходная картинка.

Для изображения на смартфоне проще всего начать со встроенного распознавания, для локального файла на компьютере — с веб-инструмента, для картинки на открытой веб-странице — с расширения браузера, а если изображение находится внутри приложения и его можно сразу передать через "Поделиться", удобным вариантом может быть Telegram-бот.

Для сравнения я взяла четыре разных подхода:

  • встроенное распознавание текста на смартфоне
  • веб-инструмент
  • расширение браузера
  • Telegram-бот

Здесь я специально не сравниваю качество OCR, дополнительные функции или конкретные сервисы, потому что для этого будет отдельный тест. Сейчас меня интересует другое: сколько и каких действий реально нужно сделать, чтобы получить текст из картинки и использовать его дальше.

Для каждого способа я прошла базовый сценарий от исходного изображения до момента, когда распознанный текст уже можно использовать в другом приложении.

Способ распознавания текстаОсновной путь
Встроенная функция распознавания текста на смартфонеОткрыть галерею → найти нужное изображение → открыть изображение → запустить встроенное распознавание текста → выделить нужный текст → скопировать → открыть приложение, где нужен текст → вставить
Веб-инструментОткрыть браузер → перейти на сайт веб-инструмента → загрузить изображение с устройства или вставить прямую ссылку на изображение → запустить распознавание → получить текст → скопировать или скачать результат → открыть приложение, где нужен текст → вставить текст или загрузить файл
Расширение браузераОткрыть браузер на нужной странице → открыть расширение → загрузить сохранённое на устройстве изображение или выбрать область на открытой веб-странице → запустить распознавание → получить текст → скопировать → открыть приложение, где нужен текст → вставить
Telegram-ботНайти нужное изображение и нажать "Поделиться" → выбрать Telegram → выбрать ImgTxtApp by LaVioLab → получить распознанный текст → скопировать или нажать "Поделиться" → передать текст в нужное приложение

На первый взгляд разница небольшая, потому что везде нужно каким-то образом передать изображение, распознать текст и забрать результат, но дальше начинаются нюансы.

Встроенное распознавание на смартфоне

Начала я с самого очевидного варианта, встроенного распознавания текста на смартфоне. Подробнее о том, как оно работает на iPhone и Android, я рассказывала в отдельной статье.

Если картинка уже лежит в галерее, все действительно довольно просто:

Открыть галерею → найти изображение → открыть его → запустить встроенное распознавание → выделить нужный текст → скопировать → перейти в другое приложение → вставить

Путь из восьми шагов на телефоне: галерея, поиск изображения, его открытие, запуск распознавания текста, выделение текста, копирование, открытие заметок и вставка

Получилось 8 действий, и для одного скриншота или фотографии это вполне простой способ скопировать текст с картинки без отдельной программы: ничего дополнительно устанавливать, открывать в браузере или загружать в отдельный сервис не нужно.

Но есть 3 важных нюанса.

1. Изображение уже должно быть на смартфоне

Если оно находится на компьютере, в облачном хранилище или Instagram, сначала его нужно передать на телефон, скачать или сделать скриншот, поэтому к нашим восьми действиям сразу добавляются дополнительные.

2. Нужный текст приходится выделять вручную

Встроенное распознавание на iPhone: на информационном стенде подсвечено несколько отдельных блоков текста, над ними открыто меню 'Скопировать, Выбрать все, Найти'

Как видно на скриншоте, распознается не только основной текст, который мне нужен, но и другие надписи и детали на изображении, поэтому нужные фрагменты приходится выделять вручную, а иногда и по частям.

3. Готовый текст нужно вручную перенести дальше

После распознавания его нужно скопировать, открыть приложение, где он понадобится, и вставить, поэтому на получении текста сам workflow еще не заканчивается.

Встроенное распознавание оказывается самым коротким путем только тогда, когда изображение уже лежит в галерее, — все до и после этого ложится на вас.

Веб-инструмент

Следующим я проверила обычный веб-инструмент, где путь уже немного другой:

Открыть браузер → перейти на сайт инструмента → загрузить изображение → запустить распознавание → получить текст → скопировать → перейти в другое приложение → вставить

Путь из восьми шагов для веб-инструмента: открыть браузер, перейти на сайт, загрузить изображение или вставить ссылку, запустить распознавание, получить текст, скопировать или скачать, открыть нужное приложение и вставить

В базовом сценарии снова получилось 8 действий, причем если изображение уже находится на компьютере или смартфоне, все довольно просто: открываем сайт и загружаем файл.

У некоторых веб-инструментов есть еще один вариант, можно вставить ссылку на изображение, но вот здесь я как раз обнаружила интересное ограничение. Сервисы, которые я проверяла, принимают только прямые URL изображений, а просто вставить ссылку, например на Instagram-пост, и попросить сервис самому достать оттуда изображение уже не получилось.

Поэтому, если картинка находится в Instagram или другой социальной сети, ее сначала нужно сохранить или сделать скриншот, а уже потом вернуться в браузер и загрузить файл, из-за чего к базовому пути снова добавляются дополнительные действия.

С готовым текстом все примерно так же, как и в прошлом способе: после распознавания его нужно скопировать, открыть приложение, где он понадобится, и вставить вручную, хотя в некоторых веб-сервисах результат также можно скачать в файл.

Расширение браузера

С расширениями браузера оказалось интереснее. Я попробовала несколько вариантов из Chrome Web Store, чтобы понять общий принцип работы, а не возможности одного конкретного расширения.

В основном мне встретились два сценария: можно загрузить изображение, которое уже сохранено на компьютере, либо выбрать область прямо на открытой веб-странице и распознать текст там.

Получается примерно такой путь:

Открыть нужную страницу в браузере → открыть расширение → загрузить изображение или выбрать область страницы → запустить распознавание → получить текст → скопировать → перейти в другое приложение → вставить

Путь из восьми шагов для расширения браузера: открыть страницу, открыть расширение, загрузить изображение или выбрать область, запустить распознавание, получить текст, скопировать, открыть нужное приложение и вставить

В базовом сценарии снова получилось 8 действий, но здесь есть важное ограничение: браузерные расширения работают только на компьютере, поэтому на смартфоне этот способ недоступен. Если исходное изображение находится на телефоне, его сначала придется передать на компьютер, а значит, к основному пути добавятся дополнительные действия.

Ссылку на Instagram-пост или другую публикацию в социальной сети в проверенных мной расширениях тоже нельзя было просто вставить и отправить на распознавание, поэтому здесь, как и с веб-инструментами, может потребоваться сначала сохранить изображение.

С готовым текстом все уже знакомо: его нужно скопировать, открыть приложение, где он понадобится, и вставить вручную.

Три способа из четырех дают одно и то же число действий и заканчиваются одинаково: скопировать, переключиться, вставить.

Telegram-бот

Последним я проверила вариант с Telegram-ботом на примере ImgTxtApp by LaVioLab, и здесь путь устроен немного иначе.

Во многих случаях изображение можно передать через системную функцию "Поделиться" прямо из того места, где оно находится: из социальной сети, браузера, другого приложения, галереи смартфона или облачного хранилища. Поэтому его не обязательно сначала сохранять, потом отдельно открывать Telegram, искать файл и загружать его еще раз.

Получается такой путь:

Найти изображение или Instagram-пост → нажать "Поделиться" → выбрать Telegram и ImgTxtApp by LaVioLab → получить текст → скопировать → перейти в нужное приложение → вставить

Путь из шести шагов на телефоне: нажать 'Поделиться' на изображении, выбрать Telegram, выбрать ImgTxtApp by LaVioLab, получить распознанный текст, скопировать или переслать его и вставить в другое приложение

В моем тесте получилось 7 действий, причем здесь мне показался важным не столько выигрыш в одно действие, сколько то, где может находиться исходная картинка. Если в приложении или сервисе доступна функция "Поделиться", изображение можно сразу передать в Telegram без промежуточного сохранения.

С готовым текстом есть два варианта: если он нужен в другом приложении, его можно скопировать, перейти туда и вставить вручную, а если работа продолжается внутри Telegram, результат можно сразу переслать в другой чат, группу или даже другому боту, например, если следующим шагом нужно перевести текст.

Отправка прямо из того приложения, где уже лежит изображение, убирает крюк с сохранением и повторной загрузкой.
Подробнее об ImgTxtApp

А что, если картинка находится не там, где нужен инструмент?

Вот здесь, на мой взгляд, начинается самая интересная часть сравнения, потому что просто сказать "этот способ занимает 8 действий, а этот меньше" недостаточно.

Представим, что изображение находится на компьютере. В этом случае веб-инструмент или расширение браузера можно использовать сразу, а для встроенного распознавания на смартфоне картинку сначала придется передать на телефон. Если же перенести ту же картинку на смартфон, ситуация меняется: встроенное распознавание становится доступно сразу, а для расширения браузера файл, наоборот, придется сначала передать на компьютер.

Поэтому я отдельно сравнила все четыре подхода в зависимости от того, где находится исходное изображение.

Способ распознавания текстаЕсли изображение на компьютереЕсли изображение на смартфонеЕсли изображение в облачном хранилищеЕсли изображение в Instagram
Встроенная функция распознавания текста на смартфоненужно передать на смартфонможно использовать напрямуюнужно сделать скриншот или скачать на смартфоннужно сделать скриншот или скачать на смартфон
Веб-инструментможно использовать напрямуюможно использовать напрямуюнужно сделать скриншот или скачать на устройствонужно сделать скриншот или скачать на устройство
Расширение браузераможно использовать напрямуюнужно передать на компьютернужно сделать скриншот или скачать на устройствонужно сделать скриншот или скачать на устройство
Telegram-ботможно использовать напрямуюможно использовать напрямуюможно использовать напрямуюможно использовать напрямую

И здесь разница уже видна гораздо лучше. Встроенное распознавание удобнее всего, когда изображение уже находится на смартфоне, а веб-инструмент хорошо работает с локальным файлом и на компьютере, и на телефоне. Но если изображение находится внутри другого сервиса и прямой ссылки на сам файл нет, его сначала нужно сохранить.

Расширение браузера оказалось самым привязанным к устройству из четырех способов, потому что использовать его получится только на компьютере. А Telegram-бот, наоборот, оказался менее привязан к тому, где изначально находится изображение: во всех четырех проверенных сценариях его можно было передать напрямую.

И что в итоге: сколько действий получилось?

После всех тестов я свела результаты еще в одну таблицу и посчитала, сколько именно действий нужно совершить пользователю.

Способ распознавания текстаКоличество действий до готового текстаНужна предварительная установка инструментаНужна регистрация / авторизация для постоянного использованияЧто можно сделать с распознанным текстом дальше
Встроенная функция распознавания текста на смартфоне8НетНетСкопировать → вручную перейти в другое приложение → вставить
Веб-инструмент8НетЗависит от инструментаСкопировать → вручную перейти в другое приложение → вставить. Некоторые сервисы также позволяют скачать результат в файл
Расширение браузера8ДаДаСкопировать → вручную перейти в другое приложение → вставить
Telegram-бот7НетНетСкопировать → вручную перейти в другое приложение → вставить. Или можно сразу переслать в другой чат, группу или даже другому боту

В базовом сценарии получилось:

  • встроенное распознавание на смартфоне: 8 действий
  • веб-инструмент: 8 действий
  • расширение браузера: 8 действий
  • Telegram-бот: 7 действий

Но я бы не воспринимала эти цифры как рейтинг в духе "7 всегда лучше 8", потому что интерфейсы конкретных сервисов отличаются, а местоположение картинки, как мы уже увидели, может добавить к базовому пути еще несколько действий.

Мне кажется, здесь интереснее другой вывод: сам OCR обычно вообще не является проблемой, а неудобство создают лишние действия, которые появляются вокруг него:

Сохранить изображение → открыть другой сервис → загрузить файл → распознать текст → скопировать → вернуться в нужное приложение → вставить

Каждый отдельный шаг кажется мелочью, но именно из этих мелочей складывается весь workflow, а вместе с ним и пользовательский опыт, поэтому один и тот же способ может оказаться очень удобным в одной ситуации и заметно менее удобным в другой.

Что в итоге и какой способ выбрать

Я начинала этот тест с довольно простого вопроса: какой способ быстрее, но в итоге пришла к немного другому выводу.

Сам текст сейчас умеют распознавать очень разные инструменты, поэтому гораздо полезнее смотреть не только на возможности OCR, но и на весь путь от исходного изображения до готового текста. Важно учитывать, где изначально находится картинка, нужно ли ее сначала сохранять или переносить на другое устройство, сколько действий потребуется для распознавания и что потом придется сделать, чтобы текст оказался там, где вы собираетесь с ним работать.

Если изображение уже лежит на смартфоне, самым естественным вариантом может оказаться встроенное распознавание, а для локального файла на компьютере хорошо подойдет веб-инструмент. Если же изображение уже открыто на веб-странице, можно воспользоваться расширением браузера.

Telegram-бот становится особенно удобным, когда картинка находится внутри другого приложения и ее можно сразу передать через "Поделиться". В этом случае не нужно сначала сохранять изображение на устройство, а потом заново загружать его в инструмент, поэтому часть промежуточных действий просто исчезает.

Так что мой главный вывод после этого эксперимента довольно простой: лучший способ распознать текст с картинки тот, который требует меньше лишних действий на пути от исходного изображения до места, где вам нужен готовый текст.

Попробуйте сами

Ну и раз уж один из способов в этом тесте — мой собственный бот, оставлю его здесь ☺️

Первые 2 распознавания в ImgTxtApp by LaVioLab доступны бесплатно.

Можно отправить в бот обычное изображение или Instagram-пост, а если картинка находится в другом приложении, передать её напрямую через "Поделиться". В ответ вы получите готовый редактируемый текст, который можно использовать дальше.

Попробовать ImgTxtApp