Конспект Системы распознавания текста

Раздел Информатика
Класс -
Тип Конспекты
Автор
Дата
Формат docx
Изображения Есть
For-Teacher.ru - все для учителя
Поделитесь с коллегами:

Сканирование документов с помощью компонента «Факсы и сканирование Windows»

Убедитесь, что сканер правильно установлен и включен.

  1. Нажмите кнопку ПускКонспект Системы распознавания текста, выберите пункт Все программы, а затем нажмите Факсы и сканирование Windows.

  2. Нажмите кнопку Сканировать внизу левой панели.

  3. На панели инструментов нажмите кнопку Новое сканирование.

  4. В диалоговом окне Новое сканирование щелкните список Профиль и выберите Документы. После этого будут автоматически отображены настройки сканирования документа по умолчанию, которые можно применить или изменить.

  5. Чтобы увидеть, как будет выглядеть отсканированный документ, нажмите Просмотр.

  6. Нажмите кнопку Сканировать.

Сканирование изображений с помощью компонента «Факсы и сканирование Windows»

Убедитесь, что сканер правильно установлен и включен.

  1. Нажмите кнопку ПускКонспект Системы распознавания текста, выберите пункт Все программы, а затем нажмите Факсы и сканирование Windows.

  2. Нажмите кнопку Сканировать внизу левой панели.

  3. На панели инструментов нажмите кнопку Новое сканирование.

  4. В диалоговом окне Новое сканирование щелкните список Профиль, а затем выберите Фото. После этого будут автоматически отображены настройки сканирования фотографии по умолчанию, которые можно применить или изменить.

  5. Чтобы увидеть, как будет выглядеть фотография, нажмите Просмотр. Если необходимо, измените параметры сканирования и просмотрите изображение снова.

  6. Нажмите кнопку Сканировать.

Тема: «Системы распознавания текста».

Цели урока:

  • помочь учащимся получить представление об OCR - программах распознавания текста, познакомиться с возможностями данных программы, научить распознавать отсканированный текст, передавать и редактировать его в Word.

  • воспитание информационной культуры учащихся, внимательности, аккуратности, дисциплинированности, усидчивости.

  • развитие познавательных интересов, навыков работы на компьютере, самоконтроля, умения конспектировать.

Оборудование:

доска, компьютер, компьютерная презентация.

План урока:

  1. Орг. момент. (1 мин)

  2. Актуализация знаний. (5 мин)

  3. Теоретическая часть. (10 мин)

  4. Практическая часть. (15 мин)

  5. Д/з (2 мин)

  6. Вопросы учеников. (5 мин)

  7. Итог урока. (2 мин)

Ход урока:

I. Орг. момент.

Приветствие, проверка присутствующих. Объяснение хода урока.

II. Актуализация знаний.

При создании электронных библиотек и архивов путем перевода книг и документов в цифровой компьютерный формат, при переходе предприятий от бумажного к электронному документообороту, при необходимости отредактировать полученный по факсу документ используются системы оптического распознавания символов.

На этом уроке мы научимся создавать преобразовывать отсканированное изображение в текст.

III. Теоретическая часть.

С помощью сканера достаточно просто получить изображение страницы текста в графическом файле. Однако работать с таким текстом невозможно: как любое сканированное изображение, страница с текстом представляет собой графический файл - обычную картинку.Текст можно будет читать и распечатывать, но нельзя будет его редактировать и форматировать. Для получения документа в формате текстового файла необходимо провести распознавание текста, то есть преобразовать элементы графического изображения в последовательности текстовых символов.

Преобразованием графического изображения в текст занимаются специальные программы распознавания текста (Optical Character Recognition - OCR).

Современная OCR должна уметь многое: распознавать тексты, набранные не только определенными шрифтами (именно так работали OCR первого поколения), но и самыми экзотическими, вплоть до рукописных. Уметь корректно работать с текстами, содержащими слова на нескольких языках, корректно распознавать таблицы. И самое главное - корректно распознавать не только четко набранные тексты, но и такие, качество которых, мягко говоря, далеко от идеала. Например, текст с пожелтевшей газетной вырезки или третьей машинописной копии. Само собой, распознать текст - это еще полдела. Не менее важно обеспечить возможность сохранения результата в файле популярного текстового (или табличного) формата - скажем, формата Microsoft Word.

Как видим, для того, чтобы получить электронную, готовую к редактированию копию любого печатного текста, программе OCR необходимо выполнить «цепочку» из множества отдельных операций.

Сначала необходимо распознать структуру размещения текста на странице: выделить колонки, таблицы, изображения и так далее. Далее выделенные текстовые фрагменты графического изображения страницы необходимо преобразовать в текст.

Если исходный документ имеет типографское качество (достаточно крупный шрифт, отсутствие плохо напечатанных символов или исправлений), то задача распознавания решается методом сравнения с растровым шаблоном. Сначала растровое изображение страницы разделяется на изображения отдельных символов. Затем каждый из них последовательно накладывается на шаблоны символов, имеющихся в памяти системы, и выбирается шаблон с наименьшим количеством отличных от входного изображения точек.

При распознавании документов с низким качеством печати (машинописный текст, факс и так далее) используется метод распознавания символов по наличию в них определенных структурных элементов (отрезков, колец, дуг и др.).

Любой символ можно описать через набор значений параметров, определяющих взаимное расположение его элементов. Например, буква «Н» и буква «И» состоят из трех отрезков, два из которых расположены параллельно друг другу, а третий соединяет эти отрезки. Различие между данными буквами - в величине углов, которые образует третий отрезок с двумя другими.

При распознавании структурным методом в искаженном символьном изображении выделяются характерные детали и сравниваются со структурными шаблонами символов. В результате выбирается тот символ, для которого совокупность всех структурных элементов и их расположение больше всего соответствует распознаваемому символу.

Наиболее распространенные системы оптического распознавания символов, например, ABBYY FineReader и CuneiForm от Cognitive,используют как растровый, так и структурный методы распознавания. Кроме того, эти системы являются «самообучающимися» (для каждого конкретного документа они создают соответствующий набор шаблонов символов) и поэтому скорость и качество распознавания многостраничного документа постепенно возрастают.

При заполнении налоговых деклараций, при проведении переписей населения и так далее используются различного вида бланки с полями. Рукопечатные тексты (данные вводятся в поля печатными буквами от руки) распознаются с помощью систем оптического распознавания форм и вносятся в компьютерные базы данных.

Сложность состоит в том, что необходимо распознавать написанные от руки символы, довольно сильно различающиеся у разных людей. Кроме того, система должна определить, к какому полю относится распознаваемый текст.

Системы распознавания рукописного текста. С появлением первого карманного компьютера Newton фирмы Apple в 1990 году начали создаваться системы распознавания рукописного текста. Такие системы преобразуют текст, написанный на экране карманного компьютера специальной ручкой, в текстовый компьютерный документ.

Программы для распознавания текста вы можете приобрети отдельно или получить бесплатно вместе с купленным вами сканером.

Возможно, самая известная программа для распознавания текстов - это FineReader от компании ABBYY. Именно эту программу чаще всего вспоминают, когда речь заходит о системах распознавания.

FineReader - омнифонтовая система оптического распознавания текстов. Это означает, что она позволяет распознавать тексты, набранные практически любыми шрифтами, без предварительного обучения. Особенностью программы FineReader является высокая точность распознавания и малая чувствительность к дефектам печати, что достигается благодаря применению технологии "целостного целенаправленного адаптивного распознавания".

FineReader имеет массы дополнительных функций, которые простому пользователю, возможно, и без надобности, но зато производят впечатление на определенные группы покупателей. Так, одним из козырей FineReader является поддержка неимоверного количества языков распознавания - 176, в числе которых вы найдете экзотические и древние языки, и даже популярные языки программирования.

Но далеко не все возможности включены в самую простую модификацию программы, которую вы можете получить бесплатно вместе со сканером. Пакетное сканирование, грамотная обработка таблиц и изображений - для всего этого стоит приобрести профессиональную версию программы.

Все версии FineReader, от самой простой до самой мощной, объединяет удобный интерфейс. Для запуска процесса распознавания вам достаточно просто положить документ в сканер и нажать единственную кнопку (мастер Scan & Read) на панели инструментов программы. Все дальнейшие операции - сканирование, разбивку изображения на «блоки» и, наконец, собственно распознавание программа выполнит автоматически. Пользователю останется только установить нужные параметры сканирования.

FineReader работает со сканерами через TWAIN-интерфейс. Это единый международный стандарт, введенный в 1992 году для унификации взаимодействия устройств для ввода изображений в компьютер (например, сканера) с внешними приложениями.

Качество распознавания во многом зависит от того, насколько хорошее изображение получено при сканировании. Качество изображения регулируется установкой основных параметров сканирования: типа изображения, разрешения и яркости.

Сканирование в сером является оптимальным режимом для системы распознавания. В случае сканирования в сером режиме осуществляется автоматический подбор яркости. Если Вы хотите, чтобы содержащиеся в документе цветные элементы (картинки, цвет букв и фона) были переданы в электронный документ с сохранением цвета, необходимо выбрать цветной тип изображения. В других случаях используйте серый тип изображения.

Оптимальным разрешением для обычных текстов является - 300 dpi и 400-600 dpi для текстов, набранных мелким шрифтом (9 и менее пунктов).

После завершения распознавания страницы FineReader предложит пользователю выбор: сканировать и распознавать дальше (для многостраничного документа) или сохранить полученный текст в одном из множества популярных форматов - от документов Microsoft Office до HTML или PDF. Можно, впрочем, сразу же перебросить документ в Word или Excel, и уже там исправить все огрехи распознавания (без ни обойтись просто невозможно). При этом FineReader полностью сохраняет все особенности форматирования документа и его графическое оформление.

Вопросы:

  • Зачем нужны программы распознавания текста?

  • Как происходит распознавание текста?

  • Какие программы распознания текста вы знаете? Какими пользовались?

  • Какое разрешение является оптимальным для сканирования текста, изображений?

III. Практическая часть.

Теперь потренируемся работать с программой ABBYY FineReader. Будем использовать упрощенную версию программы, поставляемую со сканером.

Запустите FineReader и откройте файл C:/Наш урок/Урок24 практика.jpg. Для этого щелкните на кнопке Открыть и выберите файл с изображением.

Распознайте это отсканированное изображение. Для этого нажмите кнопку Распознать. Прежде чем приступить к распознаванию, программа должна знать, какие участки изображения надо распознавать. Для этого проводится анализ макета страницы, во время которого выделяются блоки с текстом, картинки и таблицы. В большинстве случаев FineReader сам успешно справляется с анализом сложных страниц. Конспект Системы распознавания текста

Если программа произвела анализ страницы неправильно, можно исправить вручную. Для этого щелкните Процесс→Анализ макета страницы.

Блоки - это заключенные в рамку участки изображения. Блоки выделяют для того, чтобы указать системе, какие участки, отсканированной страницы, надо распознавать и в каком порядке. Также по ним воспроизводится исходное оформление страницы. Блоки разных типов имеют различные цвета рамок.

Текст - блок используется для обозначения текста. Он должен содержать только одноколоночный текст. Если внутри текста содержатся картинки, выделите их в отдельные блоки.

Таблица - этот блок используется для обозначения таблиц или текста, имеющего табличную структуру. При распознавании программа разбивает данный блок на строки и столбцы и формирует табличную структуру. В выходном тексте данный блок передается таблицей.

Картинка - этот блок используется для обозначения картинок. Он может содержать картинку или любую другую часть текста, которую Вы хотите передать в распознанный текст в качестве картинки.

Конспект Системы распознавания текста

Результаты распознавания можно сохранить в файл, передать во внешнее приложение, не сохраняя на диск или скопировать в буфер обмена.

Распознанный текст можно отправить в Microsoft Word. Для этого щелкните кнопку Передать в MS Word. Запуститься программа Microsoft Word и откроется распознанный текст, который вы можете редактировать и форматировать, сохранить в файл.

Учащиеся выполняют задание.

IV. Д/з

Знать, что такое программы распознавания текста, уметь работать с этими программами. Дополнительное задание: установить дома программу OCR и подготовить реферат по какому-либо предмету. Текст распознать в OCR, редактирование и форматирование провести вWord.

V. Вопросы учеников.

Ответы на вопросы учащихся.

VI. Итог урока.

Подведение итога урока. Выставление оценок.

На уроке мы познакомились с программами OCR, научились распознавать отсканированное изображение с помощью программы ABBYY FineReader 5.0.

В наш век информационных технологий и электронных подписей обычные бумажные документы ничуть не утратили своей силы. Более того, настоящие подписи и печати при личном присутствии двух сторон являются лучшими гарантами добровольного соглашения.

Однако если юридическую силу имеет только оригинал бумажного документа, то для просмотра его содержания вполне хватит и копии. И лучшим местом хранения копий выступает, конечно же, компьютер с доступом в интернет. Единственное затруднение этого способа заключается в оцифровке документа, так как сканера под рукой может не оказаться.

Для деловых людей, работающих с большим количеством бумажной документации, некоторые производители предложили мобильные сканеры. Эти компактные устройства способны менее чем за минуту создать электронную копию страницы формата А4 весьма приемлемого качества. Однако мобильные сканеры предназначены для небольшой целевой аудитории, так как единственное их предназначение - сканирование отдельных листов. Конспект лекций, интересная статья из журнала или отрывок из книги такому сканеру «не по зубам».

Поэтому для нечастого «бытового» сканирования лучшим устройством в настоящее время является камера смартфона. В принципе, любой фотоаппарат справился бы с этой задачей лучше, однако, в отличие от него, телефон мы носим с собой практически всегда.

О сканерах

Для смартфонов под управлением Android в магазине Google Play можно отыскать порядка двух десятков мобильных сканеров. Основной функционал любого из них заключается в фотографировании документа и сохранении изображения в формате PDF или JPEG. В основном используется системная камера, хотя некоторые используют «свою», оснащенную дополнительными настройками.

После получения фото приложение предлагает набор инструментов для его редактирования - поворота, обрезания, корректировки фона, цвета, контраста и т.д. После того, как работа с внешним видом документа закончена, его можно отправить в облачное хранилище: Google Docs, SkyDrive, Evernote или на собственный сервер разработчика.

К сожалению, подобный функционал доступен не всем приложениям. Разумеется, создать файл формата PDF и отправить его на указанный почтовый ящик может каждое из них. Однако лишь в некоторых случаях встречаются те мелочи, которые и делают использование программы по-настоящему удобным. Единственная черта, свойственная практически всем приложениям, - наличие платной версии с расширенными или дополнительными возможностями. Сюда можно отнести максимальное качество изображения, неограниченное количество страниц документа, пакетное «сканирование», размещение на сервере и т.п.

CamScanner - самый функциональный сканер документов

Скачать CamScanner.

CamScanner - одно из лучших приложений в данной области. Своим успехом эта программа обязана простому, понятному интерфейсу, отличной обработке фотографий и широким возможностям даже в бесплатной версии.

Конспект Системы распознавания текста

Главное окно встречает набором изображений, распределенных по тэгам. Набор тэгов можно отредактировать в диспетчере: добавить новый, удалить существующий или поменять расположение. При большом количестве изображений с помощью тэгов поиск нужного документа существенно упрощается.

Конспект Системы распознавания текста Конспект Системы распознавания текста

При наличии доступа в интернет CamScanner предлагает выгрузку изображений сразу в несколькооблачных хранилищ при наличии у пользователя соответствующего профиля: Box, Google Drive, Dropbox, Evernote и SkyDrive. Но с некоторыми ограничениями: в бесплатной версии хранилища Evernote, SkyDrive доступны лишь в течение семи дней.

Конспект Системы распознавания текста

Количество настроек сканирования не отличается особым избытком, приведены лишь основные опции: автообрезка при пакетном сканировании, качество изображения, выбор приложения для камеры и режим улучшения - режим обработки изображений по умолчанию. Впрочем, даже после пакетной съемки с автоматической обработкой можно вернуться к оригинальному изображению и самостоятельно внести все изменения.

Конспект Системы распознавания текста Конспект Системы распознавания текста

По умолчанию CamScanner использует собственное приложение для камеры. От стандартного его отличает возможность включить сетку, использовать электронный «уровень» и переключать пакетный режим сканирования на одиночный. Звук затвора, к сожалению, присутствует. Также в настройках можно задать использование системной камеры, но в таком случае пакетная съемка будет невозможна.

Конспект Системы распознавания текста

В приложении отлично реализован процесс обрезания. В основном, границы документа (страницы, визитной карточки и т.п.) определяются автоматически и практически всегда безошибочно.

Конспект Системы распознавания текста

После чего следует наиболее важный этап - обработка. Ценность мобильных сканеров в том, чтобы иметь возможность отправить полученную копию на печать. И желательно без особых нагрузок на картридж принтера, для чего нужно очистить фон изображения от лишних деталей. В режиме улучшения «Ч/Б Документ» CamScanner справляется с этой задачей отлично.

Конспект Системы распознавания текста

В отличие от некоторых конкурентов, бесплатная версия CamScanner содержит возможность пакетной съемки. Однако есть и «ложка дегтя»: все созданные PDF сопровождаются водяным знаком, который, как и реклама, исчезает только после покупки приложения.

Наконец, CamScanner поддерживает технологию оптического распознавания символов (OCR). Однако на практике оказалось, что, во-первых, среди поддерживаемых языков отсутствует русский. Во-вторых, для более-менее приемлемого распознавания текста качество снимка должно быть очень высоким. Поэтому для решения данного вопроса мы рекомендуем воспользоваться возможностями Google Drive или других сторонних программ.

Camera to PDF - бесплатный сканер документов

Скачать Camera to PDF.

Простейшее приложение, которое на основе снимков с камеры смартфона или из галереи создает файл PDF. Пакетный режим как таковой отсутствует, но при создании нового документа допускается добавление очередных снимков.

Конспект Системы распознавания текста

Все действие разбивается на три этапа. Первый: выбор снимка из галереи или при помощи собственного приложения для камеры, беззвучного и с полностью отсутствующими настройками. При необходимости в текущий документ таким же образом добавляются новые страницы.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Второй этап - создание файла формата PDF. Файл сохраняется на карте памяти по следующему адресу: mnt/sdcard/Android/data/com.thomasgravina.pdfscanner/files. Опции редактирования пути нет.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Третий этап является опциональным: отправка документа при помощи обычного «send to». Какой-либо обработки изображения не предусмотрено. Поэтому вряд ли приложение сможет заинтересовать как серьезный «сканер» для работы с документами.

Document Scanner - сканер с возможностью пользоваться настройками камеры

Скачать Document Scanner.

В отличие от предыдущего приложения, данный сканер позволяет своему владельцу воспользоваться некоторыми настройками и камеры, и обработки, создать многостраничный документ и загрузить его на Google Drive.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Минус заключается в том, что бесплатная версия приложения будет работать всего лишь семь дней, после чего намертво заблокируется. А при попытке загрузки будет отправлять пользователя на страницу Google Play за покупкой полной версии.

Droid Scan Lite - сканер с запутанным интерфейсом

Скачать Droid Scan Lite.

Приложение с неплохими возможностями, но слегка запутанным интерфейсом из-за нескольких рабочих столов и большого количества тэгов. К тому же в бесплатной версии недоступно создание многостраничных документов.

Конспект Системы распознавания текста

Некоторое время придется потратить на привыкание к организации главной «галереи» приложения. Разработчик предоставил возможность создания «проектов». Каждый из них, в свою очередь, может содержать «сканы», разнесенные по тэгам. В результате, при большом количестве изображений это может вызвать затруднения при поиске.

Конспект Системы распознавания текста

По умолчанию приложение использует системное приложение для камеры, хотя в настройках можно разрешить доступ к другим приложениям. Впрочем, в нашем случае при включенной опции Droid Scan Lite не смог найти программу PicsArt, оснащенное «своей» камерой.

После получения снимка первый этап обработки - обрезание. Автоматическое определение углов срабатывает не всегда так, как нам хотелось бы. Поэтому приходится прибегать к ручному редактированию. Углы многоугольника перемещаются очень медленно, поэтому простейшая операция отнимает довольно много времени.

Конспект Системы распознавания текста

Переходим к режимам улучшения. Не считая настроек контраста и яркости, их здесь три: исходный вариант цвета, цвет с малой насыщенностью и черно-белый вариант. Поколдовав с настройками, от изображения документа, полученного при фотографировании в хороших условиях, можно получить неплохую электронную копию. Хотя некоторые «артефакты» на фоне все-таки остаются.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Шутка это или нет, однако, изучив приложение «от и до», мы так и не смогли отыскать опцию сохранения изображения в формате PDF. Скорее всего, это свойственно только платной версии. Все «сканы» хранятся на карте памяти в формате JPG в каталоге, расположенному по пути mnt/sdcard/Droid Scan.

Genius Scan - сканер документов с простым интерфейсом

Скачать Genius Scan.

Разработчики данного приложения решили заложить в свое творение философию «все гениальное просто». Документ фотографируется, обрабатывается (слегка) и сохраняется в файл формата PDF. К чести создателей стоит признать, что приложение заслуживает интереса, хотя круг пользователей будет небольшим.

Конспект Системы распознавания текста

На закладке SCANS находятся изображения, которые пока что не были перемещены в определенный документ. Список можно пополнить при помощи камеры или импортом изображения. В последнем случае необходимо сначала включить камеру, а потом нажать на пиктограмму в левом нижнем углу. Genius Scan использует собственное приложение для камеры. Основное ее отличие - беззвучная работа. Пакетная съемка не поддерживается, однако возможность создавать многостраничные документы предусмотрена.

Конспект Системы распознавания текста

После получения снимка выполняется автоматическое определение границ документа. По нашим наблюдениям, примерно в 7 из 10 случаев границы определяются корректно, лишь иногда приходится принимать участие лично. Однако, в отличие от Droid Scan Lite, хлопот это не доставляет.

После обрезки выполняется улучшение цвета. Доступны следующие режимы: без изменений, цвет и черно-белый. Режимы можно выбирать как вручную, так и установить «по умолчанию».

Конспект Системы распознавания текста Конспект Системы распознавания текста

После завершения редактирования изображение можно вставить в уже существующий документ как следующую страницу или в новый документ. Чтобы создать очередную страницу документа, весь процесс придется повторить заново.

Конспект Системы распознавания текста

Handy Scanner - простой и удобный сканер документов

Скачать Handy Scanner.

Приложение Handy Scanner отличается едва ли не более простым интерфейсом, чем предыдущее. Но при этом данный сканер обладает неплохими возможностями для создания многостраничных документов в бытовых условиях.

Конспект Системы распознавания текста

К сожалению, бесплатная версия имеет некоторые ограничения. Во-первых, максимальное количество документов составляет всего 20, по 5 страниц в каждом. Пакетная съемка ограничена тремя кадрами подряд. Реклама. Низкое и среднее качество изображения, а также отсутствие некоторых настроек при улучшении. Наконец, на PDF накладывается водяной знак.

Итак, приступаем к съемке. Используется собственный интерфейс для камеры, звук щелчка затвора присутствует. В настройках - включение вспышки, сетка и уровень. Возможна пакетная съемка, впоследствии обработка каждого фото выполняется отдельно.

Конспект Системы распознавания текста

Автоматическое определение границ срабатывает отлично, наше вмешательство минимально. Следующий шаг - улучшение, доступно шесть режимов. Напомним, что предусмотрены дополнительные настройки, но только для платной версии. После завершения редактирования изображение помещается в уже существующий или новый документ.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Также хочется заглянуть в настройки самого приложения. Полученные снимки можно автоматически сохранять в хранилище Dropbox или Google Drive, используя любое подключение или только Wi-Fi. При желании можно использовать системную камеру, отключить определение углов и фильтры, задать ориентацию страницы и ее размер.

Конспект Системы распознавания текста Конспект Системы распознавания текста

В заключение хочется отметить быструю работу приложения и его качество в целом. Несмотря на скромный вид, Handy Scanner отлично справляется со своей задачей.

Mobile Doc Scanner Lite - многофункциональный сканер документов

Скачать Mobile Doc Scanner Lite.

Удобная, быстрая программа с широкими возможностями, не уступающая CamScanner. Есть бесплатная и платная версии. В отличие от полной версии, в Lite пакетный режим поддерживает сканирование максимум 4 страниц, присутствует реклама, а все изображения сопровождаются небольшим водяным знаком.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Для съемки может использоваться системное или собственное приложение. В последнем, как видно на изображении, обозначен «верх» документа и присутствует переключатель портретной или ландшафтной ориентации. Звук затвора отсутствует.

Конспект Системы распознавания текста

После получения снимка выполняется определение углов - довольно точно, особо придраться не к чему. На этом же экране указывается вариант для обработки изображения, всего 11 вариантов, в том числе и для различных типов документов: цветной, черно-белый, журнальная страница, снимки на лету, чеки и счета и др.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Кроме того, после обработки можно воспользоваться еще несколькими фильтрами. Полученное изображение можно сохранить в формате JPG или PDF, передать другому приложению, а также отредактировать заново. MD Scan Lite сохраняет в формате JPG все изначальные снимки.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Конспект Системы распознавания текста

Однако при сканировании в пакетном режиме приложение версии 2.0.38 полученные фотографии не обрабатывает ни вручную, ни автоматически. При этом на экране появляется сообщение с предложением произвести обработку или удалить страницы из списка подлежащих обработке. Возможно, в следующих версиях эта ошибка будет исправлена.

Scan Master - сканер документов с самым удобный интерфейсом

Скачать Scan Master.

Scan Master - скорее красивое, чем функциональное приложение. Отличный пользовательский интерфейс, удобный просмотр документов по тэгам сопровождается малым количеством режимов по улучшению изображения и, как ни странно, полным отсутствием настроек.

Конспект Системы распознавания текста

Для того чтобы открыть список тэгов, следует провести пальцем по экрану справа налево. После нажатия кнопки настроек можно изменить порядок тэгов, добавить новые или удалить существующие. По такому же принципу работает и CamScanner, на практике это очень удобно.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Переходим к сканированию. Используется собственное приложение для камеры с поддержкой пакетного режима. Однако здесь есть небольшой нюанс: обработка выполняется только для одиночных фотографий. В пакетном режиме приложение просто «склеивает» несколько фотографий в один документ, пропуская шаги по обрезке и улучшению. Звук щелчка затвора присутствует.

Конспект Системы распознавания текста

После того, как было сделано одиночное фото, выполняется операция по обрезке с автоматическим определением углов. Точность не 100%, но все же достаточно высокая, чтобы это вызывало неудобства.

После обрезки нам доступна единственная операция по улучшению: настройка детализации, яркости и контраста. Этого может быть катастрофически мало, если в дальнейшем пользователь планирует работать с текстовыми документами и отправлять их на печать.

Конспект Системы распознавания текста Конспект Системы распознавания текста

После завершения редактирования предлагается добавить новую страницу из галереи или при помощи камеры. Также можно определить новый порядок полученных страниц, удалить ненужные и создать файл формата PDF.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Однако если на экране телефона «сканы» выглядят как будто бы нормально, то при первом же взгляде на монитор компьютера, куда был отправлен документ, нас постигло сильнейшее разочарование. Качество изображения настолько низкое, что в дальнейшем использовании приложения просто нет смысла.

Конспект Системы распознавания текста

Однако нам очень хотелось бы, чтобы в следующих версиях этот «недочет» был исправлен, так как у Scan Master с такими внешними данными есть все шансы на успех.

Mobile OCR Free - распознание текста на Android

Скачать Mobile OCR Free.

Те приложения, которые мы уже описали, позволяют получить лишь изображение документа в виде файла формата PDF или JPG. Текст, к сожалению, также остается лишь частью картинки без возможности его редактирования в текстовом редакторе.

Этот вопрос предлагается решить следующим образом: зарегистрировать аккаунт в Google Drive и отправлять все «сканы» на сервер. При этом в настройках загрузки Google Drive должна быть включена опция «преобразовывать текст из файлов PDF и изображений». В результате хорошо читаемые документы будут преобразованы в обычный текст, который можно скопировать в любой редактор.

Но можно пойти и другим путем: установить приложение, позволяющее распознать текст сфотографированной страницы. В качестве примера мы решили рассмотреть Mobile OCR Free.

Слово «Free» в названии говорит о том, что данная версия бесплатна и некоторые ее возможности ограничены. В данном случае ограничение касается количества поддерживаемых языков, здесь их всего четыре. Русского языка нет, но есть английский, что позволит проверить работоспособность программы.

Конспект Системы распознавания текста

Для работы приложения необходимо подключение к интернету. В качестве исходного материала мы взяли страницу учебника по английскому языку и надпись на коробке от маршрутизатора. Освещение - лампы дневного света, расстояние до объекта примерно 30-35 см.

Конспект Системы распознавания текста Конспект Системы распознавания текста

Результат, как видно из примеров, получился вполне приемлемым, хотя в первом случае небольшое редактирование все же не будет лишним. Тем не менее, на наш взгляд, в некоторых случаях быстрое распознавание способно значительно сэкономить временные затраты. Остается лишь соблюдать два условия: хорошее освещение и подключение к интернету.

Вывод

Исходя из результатов нашего обзора, первое место присуждается мобильному сканеру CamScanner. Приложение даже в бесплатной версии умеет правильно определять углы документа, не искажает перспективу, отлично проводит обработку изображения и позволяет настроить автоматическую синхронизацию с популярными «облачными» хранилищами.

Второе место «с натяжкой» получил сканер Mobile Doc Scanner Lite. По функционалу, качеству изображения и его обработке данное приложение не уступает CamScanner. Однако перебои в работе пакетной съемки, отсутствие удобных тэгов и водяной знак на PDF-копии заслуживают лишь второго места.

Наконец, третье место занял простой, но удобный Handy Scanner. Главной причиной такой оценки стали ограничения, накладываемые на бесплатную версию. Тем не менее, текст документов на фото среднего качества остается читабельным, лишь бы руки не дрожали.

В целом, мобильные сканеры для смартфонов под управлением системы Android имеют право на жизнь. Конечно, подобные приложения являются узкоспециальными, так как большинству пользователей необходим или полноценный сканер, или хватает обычного системного приложения для камеры «без всяких наворотов». Однако спрос есть, значит, должно быть и предложение. А какое приложение установить на свой смартфон - решать вам.

Конспект Системы распознавания текста

Конспект Системы распознавания текста



© 2010-2022