KTNI_Козлов(ответы) / 11
Оптическое распознавание символов (англ. optical character recognition, OCR) — механический или электронный перевод изображений рукописного, машинописного или печатного текста в текстовые данные — последовательность кодов, использующихся для представления символов в компьютере (например, в текстовом редакторе).
Задача оптического распознавания
— Перевод документов, научных публикаций, социальной информации, исторических изданий в электронный вид.
— Накопление и хранение электронных документов.
1929 году — Густав Таушек (Gustav Tauschek) получил патент на метод оптического распознавания текста в Германии;
1933 год — Гендель (Paul W. Handel) получил патент на свой метод в США ;
1935 год – Г. Таушек также получил патент США на свой метод;
1950 год — Дэвид Х. Шепард (David H. Shepard) — построил машину, решающую задачу преобразования печатных сообщений в машинный язык для обработки компьютером.
1955 год — Первая коммерческая система была установлена на «Ридерс Дайджест»
1965 год — «Ридерс Дайджест» и «Ар-Си-Эй» начали сотрудничество с целью создать машину для чтения документов, использующую оптическое распознавание текста, предназначенную для оцифровки серийных номеров купонов «Ридерс Дайджест», вернувшихся из рекламных объявлений.
1965 год — Почтовая служба Соединённых Штатов для сортировки почты использует машины, работающие по принципу оптического распознавания текста, созданные на основе технологий, разработанных исследователем Яковом Рабиновым.
1971 год — Почта Канады использует системы оптического распознавания символов
1974 год — Рэй Курцвейл создал компанию «Курцвейл Компьютер Продактс», и начал работать над развитием первой системы оптического распознавания символов, способной распознать текст, напечатанный любым шрифтом.
1978 год — Компания «Курцвейл Компьютер Продактс» начала продажи коммерческой версии компьютерной программы оптического распознавания символов.
1992 год – Начало продажи первой коммерчески успешной программой, распознающей кириллицу, «AutoR» российской компании «ОКРУС» (ОС DOS).
Конец 60-х годов – разработка и испытание шрифтонезависимого алгоритма распознования текста выпускниками МФТИ, биофизиками: Г. М. Зенкиным и А. П. Петровым
При создании электронных библиотек и архивов путем перевода книг и документов в цифровой компьютерный формат, при переходе предприятий от бумажного к электронному документообороту, при необходимости отредактировать полученный по факсу документ используются системы оптического распознавания символов.
С помощью сканера несложно получить изображение страницы текста в графическом файле.
Однако для получения документа в формате текстового файла необходимо провести распознавание текста, т. е. преобразовать элементы графического изображения в последовательности текстовых символов.
-Сначала необходимо распознать структуру размещения текста на странице: выделить колонки, таблицы, изображения и т. д.
-Далее выделенные текстовые фрагменты графического изображения страницы необходимо преобразовать в текст.
Хорошее качество текста
Растровый метод распознавания текста
Если исходный документ имеет типографское качество (достаточно крупный шрифт, отсутствие плохо напечатанных символов или исправлений), то задача распознавания решается методом сравнения с растровым шаблоном.
-Сначала растровое изображение страницы разделяется на изображения отдельных символов.
-Затем каждый из них последовательно накладывается на шаблоны символов, имеющихся в памяти системы, и выбирается шаблон с наименьшим количеством точек, отличных от входного изображения.
Плохое качество текста
Структурный метод распознавания
При распознавании документов с низким качеством печати (машинописный текст, факс и т. д.) используется метод распознавания символов по наличию в них определенных структурных элементов (отрезков, колец, дуг и др.).
Любой символ можно описать через набор параметров, определяющих взаимное расположение eгo элементов. Например, буква «Н» и буква «И» состоят из трех отрезков, два из которых расположены параллельно друг другу, а третий соединяет эти отрезки. Различие между буквами в величине улов, которые составляет третий отрезок с двумя другими. При распознавании структурным методом в искаженном символьном изображении выделяются характерные детали и сравниваются со структурными шаблонами символов. В результате выбирается тот символ, для которого совокупность всех структурных элементов и их расположение больше всего соответствуют распознаваемому символу.

Программы распознавания текста
Преобразованием графического изображения в текст занимаются специальные программы распознавания текста (Optical Character Recognition — OCR).
Современная OCR должна уметь многое: распознавать тексты, набранные не только определенными шрифтами, но и самыми экзотическими, вплоть до рукописных. Уметь корректно работать с текстами, содержащими слова на нескольких языках, корректно распознавать таблицы. И самое главное — корректно распознавать не только четко набранные тексты, но и такие, качество которых, мягко говоря, далеко от идеала. Например, текст с пожелтевшей газетной вырезки или третьей машинописной копии. Само собой, распознать текст — это еще полдела. Не менее важно обеспечить возможность сохранения результата в файле популярного текстового (или табличного) формата — скажем, формата Microsoft Word.
Наиболее распространенные системы оптического распознавания символов, например, ABBYY FineReader и CuneiForm от Cognitive, используют как растровый, так и структурный методы распознавания. Кроме того, эти системы являются «самообучающимися» (для каждого конкретного документа они создают соответствующий набор шаблонов символов) и поэтому скорость и качество распознавания многостраничного документа постепенно возрастают.
Существует также системы On-line распознавания текста: Online OCR и ABBYY FineReader Online (http://www.onlineocr.ru, http://finereader.abbyyonline.com)
Системы оптического распознавания форм
При проведении Единого государственного экзамена, при заполнении налоговых деклараций и т. д. используются различного вида бланки с полями. Рукописные тексты (данные вводятся в поля печатными буквами от руки) распознаются с помощью систем оптического распознавания форм и вносятся в компьютерные базы данных.
Сложность состоит в том, что необходимо распознавать символы, написанные от руки, а они довольно сильно различаются у разных людей. Кроме того, система должна определить, к какому полю относится распознаваемый текст.
Системы распознавания рукописного текста. С появлением первого карманного компьютера Newton фирмы Apple в 1990 году начали создаваться системы распознавания рукописного текста. Такие системы преобразуют текст, написанный на экране карманного компьютера специальной ручкой, в текстовый компьютерный документ.
OCR-приложения
-Это приложения, которые производят сканирование и распознавание текста, от англ. Optical Character Recognition — Оптическое распознавание символов
-Это программы для перевода изображений документов в редактируемый текст, который можно затем обрабатывать в текстовых и табличных редакторах. По сравнению с ручной перепечаткой текста, такие программы дают существенный выигрыш в скорости работы, к тому же делают меньше ошибок. Еще одно достоинство — возможность сохранить иллюстрации, а они иногда не менее важны, чем текст документа.
OCR CUNEIFORM
-Это бесплатная программа сканирования и распознавания текста российского разработчика Cognitive Technologies.
-OCR CuneiForm обеспечивает быстрое, удобное и качественное распознавание текста с сохранением исходного вида документа. Поддерживается распознавание с более 20 языков, среди них русский, украинский, английский, немецкий, французский, испанский, итальянский, португальский, шведский, финский, сербский, хорватский, польский, а также распознавание смешанного русско-английского текста.
ABBYY FineReader
Популярная программа распознавания текста российской компании ABBYY
Программа производит распознавание текста с более 180 языков, для 38 из них предусмотрена встроенная проверка орфографии. Начиная с версии Professional, распознаются иврит, японский, тайский, китайский языки. Finereader открывает файлы графических форматов (TIFF, JPG, PFD, PNG и др.) в том числе DjVu – компактный формат для хранения отсканированных документов, книг.
Стоимость программы 3990 рублей
Популярная программа распознавания текста российской компании ABBYY
Программа отличается высокой скоростью и точностью распознавания. Распознаются более 120 языков с различными алфавитами: латинский, греческий алфавиты, кириллица, китайский, японский и корейский языки. Как и FineReader, OmniPage уверенно распознает документы, полученные с помощью цифровых камер с помощью технологии коррекции изображения «3D Correction».
Стоимость программы 6090 рублей
Программа сканирования и распознавания текста компании I.R.I.S.
Поддерживается распознавание текста с более 120 языков распознавания, включая русский, а также ближневосточные языки — арабский, иврит, фарси (в версии Middle-East) и японский, китайский, корейский (в версии Asian). Есть версия Readiris для Macintosh.
Вместе с поддержкой распознавания популярных форматов картинок, распознаются файлы PDF и DjVu.
3845-14875 рублей (129 $-499 $)
Microsoft Office Document Imaging
Программа распознавания текста компании Microsoft
Программа Document Imaging способна работать только с двумя языками: английским и языком локализации самого MS Office. Для поддержки других языков необходимо дополнительно устанавливать пакет Multilingual User Interface (MUI). OCR настроек в программе практически нет, программа в автоматическом режиме поддерживает распознавание типа и размера шрифтов, картинок и простых таблиц.
Как компьютер распознает текст?

Человеческое существо, взглянув на текст на этой странице, мгновенно узнает знакомые образцы, из которых состоят буквы и слова. Компьютеру, чтобы осуществить то же самое, требуется специальное оборудование и сложная программа. На первом этапе оптическое сканирующее устройство должно «прочитать» текст и ввести его в компьютер.
Затем компьютер должен проанализировать каждый символ текста, чтобы правильно идентифицировать материал. Эта задача может быть усложнена разнообразием шрифта и размера. Компьютеру следует сравнить каждый символ с имеющимися у него образцами, идентифицирующими буквы. Закончив с отгадыванием букв, компьютер сохраняет текст для дальнейшего просмотра или отпечатки. Компьютер, оборудованный синтезатором голоса, может прочитать текст вслух, после того как определен синтаксис, ударение, интонация. Чем больше входят компьютеры в повседневную жизнь, тем важнее становится их способность принимать печатный текст и читать его вслух.
Распознавание символов
Компьютеры идентифицируют символы, графику и звуки посредством распознавания образцов. Если звуки для анализа разлагаются на частоты, печатный материал идентифицируется при помощи пошагового сравнения текстовых символов с набором хранимых в памяти компьютера форм и образцов.
1. Сканирование ввода
Когда компьютер сканирует текст, он преобразует его в электрические сигналы и отсылает в память.
2. Преобразование
Образцы символов преобразованы в двоичные числа: единицы для темных частей и нули для светлых.
3. Экстрагирование
Компьютер извлекает (экстрагирует) идентифицируемые элементы каждого символа из двоичного образца при помощи одного из нескольких методов.
Модельный анализ.
Сканеры сдвигают элементы растра с границ образа и подвергают центральную или контурную линию модельному анализу. Контуры анализируются при помощи векторов направления.
Анализ формы.
Полигональные фигуры (сверху, розовый цвет) исследуют форму символа. Символ анализируется в соответствии с тем, в каких местах он соприкасается с полигонами.
Фоновый анализ.
Пока компьютер сканирует в четырех направлениях, к каждой части символа прикрепляются ярлыки (за каждой частью символа закрепляются ярлыки), указывающие, есть или нет элементы растра в данном месте.
4. Сравнивание
Информация, получаемая из извлеченных характеристик, сравнивается с набором хранимых моделей. Символы идентифицируются методом установления степени сходства с имеющимися образцами
Читая текст
Текст, идентифицированный при помощи распознавания символов, затем структурно анализируется. Этот анализ осуществляется при помощи словаря и набора синтаксических правил, хранимых в памяти компьютера. Искусственный интеллект определяет, где встречаются разрывы между слогами. Дополнительные программы снабжают компьютер информацией о произношении, интонации, ударении, и синтезатор голоса читает текст вслух.
Из пикселей — в буквы: как работает распознавание текста

OCR (англ. optical character recognition, оптическое распознавание символов) — это технология автоматического анализа текста и превращения его в данные, которые может обрабатывать компьютер.
Когда человек читает текст, он распознает символы с помощью глаз и мозга. У компьютера в роли глаз выступает камера сканера, которая создает графическое изображение текстовой страницы (например, в формате JPG). Для компьютера нет разницы между фотографией текста и фотографией дома: и то, и другое — набор пикселей.
Именно OCR превращает изображение текста в текст. А с текстом уже можно делать что угодно.
Как это устроено?
Представьте, что в алфавите есть только одна буква «А». Сделает ли это задачу преобразования картинки в текст проще? Нет. Дело в том, что у каждой буквы (и любой другой графемы) есть аллографы — различные варианты начертания.
Варианты начертания буквы «а».
Человек легко поймет, что все это буква «А». Для компьютера же есть два способа решения проблемы: распознавать символы целостно (распознавание паттерна) или выделять отдельные черты, из которых состоит символ (выявление признаков).
В 1960-х годах был создан специальный шрифт OCR-A, который использовался в документах типа банковских чеков. Каждая буква в нем была одинаковой ширины (т.н. шрифт фиксированной ширины или моноширинный шрифт).
Образец шрифта OCR-A
Принтеры для чеков работали с этим шрифтом, и для его распознавания было разработано программное обеспечение. Поскольку шрифт был стандартизирован, его распознавание стало относительно простой задачей. Следующим шагом стало обучение программ OCR распознавать символы еще в нескольких самых распространенных шрифтах (Times, Helvetica, Courier и т.д.).
Этот способ еще называют интеллектуальным распознаванием символов (англ. intelligent character recognition, ICR). Представьте, что вы — OCR-программа, которой дали множество разных букв, написанных разными шрифтами. Как вам отобрать из этого множества все буквы «А», если каждая из них немного отличается от другой?

Можно использовать такое правило: если видишь две линии, сходящиеся наверху в центре под углом, а посередине между ними горизонтальная линия, то это буква «А». Это правило поможет распознать все буквы «А» независимо от шрифта. Вместо распознавания паттерна выделяются характерные индивидуальные черты, из которых состоит символ. Большинство современных омнишрифтовых (умеющих распознавать любой шрифт) OCR-программ работают по этому принципу. Чаще всего в них используются классификаторы на основе машинного обучения (т.к. фактически перед нами стоит задача классификации картинок по классам-буквам) в последнее время некоторые OCR-движки перешли на нейронные сети.
Что делать с рукописным вводом?
Человек способен догадаться о смысле предложения, даже если оно написано самым неразборчивым почерком (если речь не идет о рецепте на лекарства, конечно).

Задачу для компьютера иногда упрощают. Например, людей просят писать почтовый индекс в специальном месте на конверте специальным шрифтом. Формы, созданные для дальнейшей обработки компьютером, обычно имеют отдельные поля, которые просят заполнять печатными буквами.
Планшеты и смартфоны, которые поддерживают рукописный ввод, часто используют принцип выявления признаков. При написании буквы «А» экран «чувствует», что сначала пользователь написал одну линию под углом, затем вторую, и, наконец, провел горизонтальную черту между ними. Компьютеру помогает то, что все признаки появляются последовательно, один за другим, в отличие от варианта, когда весь текст уже записан от руки на бумаге.
OCR по шагам
Чем лучше качество исходного текста на бумажном носителе, тем лучше будет качество распознавания. А вот старый шрифт, пятна от кофе или чернил, заломы бумаги понижают шансы.
Большинство современных OCR-программ сканируют страницу, распознают текст, а затем сканируют следующую страницу. Первый этап распознавания заключается в создании копии черно-белого цвета или в оттенках серого. Если исходное отсканированное изображение идеально, то все черное — это символы, а все белое — фон.
Хорошие OCR-программы автоматически отмечают трудные элементы структуры страницы — колонки, таблицы и картинки. Все OCR-программы распознают текст последовательно, символ за символом, словом за словом и строчка за строчкой.
Сначала OCR-программа объединяет пиксели в возможные буквы, а буквы — в возможные слова. Затем система сопоставляет варианты слов со словарем. Если слово найдено, оно отмечается как распознанное. Если слово не найдено, программа предоставляет наиболее вероятный вариант и, соответственно, качество распознавания будет не таким высоким.
Некоторые программы дают возможность просмотреть и исправить ошибки на каждой странице. Для этого они используют встроенную проверку орфографии и выделяют неверно написанные слова, что может указывать на неправильное распознавание. Продвинутые OCR-программы используют так называемый метод поиска соседа, чтобы найти слова, которые часто встречаются рядом. Этот метод позволяет исправить неверно распознанное словосочетание «тающая собака» на «лающая собака».
Кроме того, некоторые проекты, которые занимаются оцифровкой и распознаванием текстов, прибегают к помощи волонтеров: распознанные тексты выкладываются в открытый доступ для вычитки и проверки ошибок распознавания.
Для высокой точности распознавания исторического текста с необычными графическими символами, отличающимися от современных шрифтов, необходимо извлечь соответствующие изображения из документов. Для языков с небольшим набором символов это можно сделать вручную, но для языков со сложными системами письменности (например, иероглифических) ручной сбор этих данных нецелесообразен.
Для распознавания исторических китайских текстов требуется внести в OCR-программу как минимум 3000 символов, которые имеют разную частотность. Если для распознавания исторических английских текстов достаточно ручной разметки нескольких десятков страниц, то аналогичный процесс для китайского языка потребует анализа десятков тысяч страниц.
В то же время многие исторические варианты китайской письменности имеют высокую степень сходства с современным письмом, поэтому модели распознавания символов, обученные на современных данных, часто могут давать приемлемые результаты на исторических данных, хоть и со сниженной точностью. Этот факт вместе с использованием корпусов позволяет создать систему для распознавания исторических китайских текстов. Для этого исследователь Д. Стеджен (Donald Sturgeon) из Гарварда обработал два корпуса: корпус транскрибированных исторических документов и корпус отсканированных документов желаемого стиля.
После предварительной обработки изображений и этапов сегментации символов процедура извлечения обучающих данных состояла из:
1) применения модели распознавания символов, обученной исключительно на современных документах, к историческим документам для получения промежуточного результата оптического распознавания с низкой точностью;
2) использование этого промежуточного результата для соотнесения изображения с его вероятной транскрипцией;
3) извлечение изображений размеченных символов на основе этого соотнесения;
4) выбор из размеченных символов подходящих обучающих примеров.
Полученные данные могут использоваться без проверки для обучения новой модели распознавания символов, позволяющей достичь более высокой точности на аналогичном материале.
Сканирование и системы, обеспечивающие распознавание символов
Системы, обеспечивающие распознавание символов — это технология оптического распознавания символов и их извлечения из изображений, сканов и PDF-файлов.
Общие сведения о сканировании
Практически все пользователи компьютеров неизбежно могут столкнуться с проблемой преобразования документов из бумажного формата в электронный формат. Но операция ввода информации в ручном режиме способна отнимать очень большое количество времени с возможностью допустить массу ошибок. Помимо этого, в ручном режиме можно ввести только тексты, но никак не изображения. Выходом из данной ситуации может служить сканер, который позволяет вводить в компьютер, как изображения, так и текстовые документы. Сканеры способны считывать с бумаги, пленки или других твердых носителей «аналоговые» тексты или изображения и преобразовать их в цифровую форму.
Сканером, в английском написании scanner, является устройство ввода текстовой или графической информации в компьютер путем преобразования ее в цифровую форму для последующего использования, обработки, хранения или вывода.
Сканированием является процесс оцифровки изображений, или по-другому, перевод его в компьютерный формат. Сравнительно недавно эта область была уделом только профессионалов, но затем технический прогресс предоставил возможность сканирования изображений и рядовым пользователям.
Сканирование и системы, обеспечивающие распознавание символов
Сканер может выполнять следующие операции:
- сканирования изображений;
- сканирования текстов с целью их последующего распознавания.
Под распознаванием текстовой информации понимается процесс преобразования изображений буквенных и цифровых символов в цифровой формат для обеспечения возможности их дальнейшей обработки при помощи текстовых редакторов.
Следует отметить, что при сканировании изображений может появиться цифровой шум, который является следствием не идеальности конструкции электронных узлов сканеров, таких как, светочувствительные элементы и их цепи. Но почему-то, производители сканеров предпочитают не указывать уровень цифрового шума в характеристиках продаваемых устройств. Вероятно, это можно объяснить тем обстоятельством, что на текущий момент нет стандартизированной методики измерения этой характеристики.
Применительно к отсканированным изображениям следует различать следующие виды цифрового шума:
- случайный цифровой шум,
- регулярный цифровой шум.
Случайный шум может проявляться как подобие «снега», гранулярности или хаотически расположенных инородных точек в изображении и появляется вследствие нестабильности функционирования полупроводниковых приборов (при колебаниях температуры и с течением времени), а также в результате вносимых электронными компонентами искажений. Для того чтобы минимизировать случайный шум, перед сканированием можно выполнить процедуру калибровки, при которой измеряются пороговые значения и смещение базового напряжения для каждого светочувствительного элемента.
Регулярный шум может возникать как следствие перекрестных помех, которые наводятся с соседних светочувствительных элементов, и по другим причинам. Регулярные шумы, в отличие от случайных шумов, очень хорошо заметны, так как они проявляются в виде горизонтальных, вертикальных либо диагональных полос.
Для того чтобы можно было с максимальной эффективностью использовать устройства, требуется программа распознавания текста. При помощи сканера можно сравнительно легко сформировать изображение страницы текста в графическом файле. Но вести обработку текста не представляется возможным по следующим причинам:
- Страница с текстом является просто графическим файлом, то есть, обычной картинкой.
- Нет возможности редактирования и форматирования текста.
- Следует выполнить преобразование элементов графического изображения в последовательность реальных текстовых символов.
Для преобразования графического изображения в текстовый формат служат специальные программные продукты, предназначенные для распознавания текста OCR (Optical Character Recognition). Самыми широко используемыми системами оптического распознавания символов являются следующие программы:
- Программа ABBYY FineReader.
- Программа CuneiForm.
Программное приложение ABBYY FineReader является омнифонтовой системой оптического распознавания текста. Это значит, что она предоставляет возможность распознавания текстов, набранных практически при помощи любых шрифтов, без необходимости предварительного обучения.
Характерной чертой программного приложения FineReader может считаться повышенная точность распознавания и малая чувствительность к имеющимся дефектам печати. OCR-технологии от корпорации ABBYY, помимо этого, способны поддерживать зональное распознавание (распознавание на уровне полей), которое необходимо в некоторых основных процессах бизнеса, таких как, классификация по ключевым словам, индексирование по ключевым словам и ввод данных с различных форм.
Пользователь имеет возможность настройки рабочего пространства по своему усмотрению, а именно:
- Возможность изменять расположение и размеры окон.
- Возможность настройки панели быстрого доступа, которая предназначена для доступа к наиболее часто применяемым командам.
- Возможность настройки горячих клавиш, то есть, можно как заменять предустановленные сочетания, так и добавлять свои горячие клавиши для исполнения команд программы.
- Возможность выбора необходимого языка интерфейса и прочее.
Программа ABBYY FineReader обладает следующими функциональными возможностями