Распознавание текстов очень важная задача которая возникает

от admin

Текстовый редактор

Практикум содержит 11 практических занятий с самостоятельным пошаговым выполнением каждого задания. Итог работы – многостраничный документ с автособираемым оглавлением.

Практическое занятие №1

Шрифты. Форматирование символов

Цель работы: изучить и освоить возможности MSWord при работе со шрифтами.

Начало работы: создайте в папке Мои документы папку, названную Вашей фамилией. Все работы сохраняйте только в свою папку.

Запустите программу MSWord:Пуск Все программы MicrosoftOffice 2013Word 2013.

Прочитайте пояснения, найдите и рассмотрите на экране вкладку Шрифт.

Шрифт – это набор букв, цифр, специальных символов и знаков препинания. В понятие шрифта входят: тип шрифта (гарнитура), размер шрифта, начертание.

1. Тип шрифта (гарнитура) – наиболее распространенными шрифтами в России являются: TimesNewRoman,

2. Размер обычно выражается в пунктах (points). Один пункт соответствует 0,376 мм:

для основного текста обычно выбирают размер 12,

для заголовков – 14 и выше,

для сносок и примечаний – 8.

3. Начертание

Можно использовать разные сочетания начертаний:

полужирный + курсив

полужирный + подчеркнутый

курсив + подчеркнутый

полужирный + курсив +подчеркнутый

Установите для Вашего документа размер шрифта 14
и гарнитуру TimesNewRoman.

Задание 1. Копирование и вставка строки

«Я изучаю MicrosoftWord успешно».

Скопируйте данную фразу и вставьте ее три раза.

Для этого выделите данную фразу (поставьте курсор мыши слева от данной строки и щелкните левой кнопкой, строка «Я изучаю MicrosoftWord успешно» выделится серым цветом.):

«Я изучаю MicrosoftWord успешно».

Выполните команду Копировать:

Копия данной строки поместилась в буфер обмена, теперь ее можно вставлять в указанное место нужное число раз. Обратите особое внимание на то, что данный объект вставляется в то место, где мигает текстовый курсор. Чтобы вставить строку, поставьте курсор в нужное место и выполните команду Вставить.

Вставьте данную фразу 4 раза. Должна получиться следующая картина:

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

Внимание! Запомните 4 шага:

выделить объект, который надо копировать;

установить курсор в то место, куда надо вставить скопированный объект;

Задание 2. Изменение гарнитуры

Оформите: первую строку шрифтом TimesNewRoman,

Должно получиться так:

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

«Я изучаю MicrosoftWord успешно».

Задание 3. Изменение гарнитуры

Наберите текст по образцу (гарнитура Times New Roman):

Шрифт – это набор букв, цифр, специальных символов и знаков препинания, отображаемых определенным образом. В понятие шрифта входят: тип шрифта, размер шрифта, начертание.

Выделите и скопируйте текст, вставьте его последовательно 2 раза.

Примените различные типы шрифтов (любые). Укажите названия шрифтов.

Шрифт – это набор букв, цифр, специальных символов и знаков препинания, отображаемых определенным образом. В понятие шрифта входят: тип шрифта, размер шрифта, начертание. (Cambria)

Шрифт – это набор букв, цифр, специальных символов и знаков препинания, отображаемых определенным образом. В понятие шрифта входят: тип шрифта, размер шрифта, начертание. (Tahoma)

Шрифт – это набор букв, цифр, специальных символов и знаков препинания, отображаемых определенным образом. В понятие шрифта входят: тип шрифта, размер шрифта, начертание. (Calibri)

Задание 4. Изменение размера шрифта

Наберите слово (шрифт TimesNewRoman):

Скопируйте и вставьте слово Информатика 8 раз. Выделив предварительно каждую строку, измените размер шрифта, выбрав размер в раскрывающемся списке размеров шрифтов. Выбирайте шрифты в порядке увеличения: 8, 10, 12, 14, 16, 18, 22, 26. Должно получиться так:

Наберите последовательность чисел по образцу:

14 18 22 26 30 34

Последовательно выделяя каждое число, задайте размер шрифта в соответствии с его значением (если число 14, то размер шрифта – 14, если 18, то 18 и т.д.):

Наберите свое имя и задайте размер шрифта 100.

Задание 5. Изменение стиля начертания

Наберите текст по образцу (гарнитура TimesNewRoman):

Можно использовать различные сочетания начертаний.

Скопируйте набранный текст и вставьте его 7 раз. К каждой строке примените различное начертание символов, (жирный, курсив, подчеркнутый) чтобы получилось примерно так:

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Задание 6. Изменение цвета шрифта

Скопируйте и вставьте текст другим способом:

Пометьте все семь строк, полученные в предыдущем задании. Нажмите правую кнопку мыши и выберите пункт меню [Копировать]. Нажмите левую кнопку мыши. Установите курсор через две пустых строки, нажмите правую кнопку мыши и выберите команду [Вставить].

Последовательно выделяя каждую строку, задайте ее цвет по желанию.

Можно использовать различные сочетания начертаний.

Можно использовать различные сочетания начертаний.

Задание 7. Верхний (надстрочный знак) и нижний (подстрочный знак) индексы

Наберите текст по образцу:

a 2 + b 2 = c 2

Задание8. Изменение интервалов между символами

Наберите текст по образцу:

MicrosoftOffice 2013 Word

Выделите, скопируйте и вставьте текст 3 раза. Получится 4 одинаковые строки.

Выделяя каждую строку, примените к ней различный интервал между символами. Используйте меню Шрифт, вкладку Дополнительно.

Должно получиться так:

MicrosoftOfficeWord 2007 – обычныйинтервал

MicrosoftOfficeWord 2007 – разреженныйна 2 пт

MicrosoftOfficeWord 2007 – разреженныйна 4 пт

MicrosoftOfficeWord 2007 – уплотненныйна 1 пт

Задание9. Выполните упражнение

Наберите текст и оформите его так:

Для обработки текстовой информации на компьютере используются текстовые редакторы, которые позволяют создавать, редактировать, форматировать, сохранять и распечатывать документы.

Times New Roman
размершрифта — 11

Приложение WindowsБлокнот позволяет редактировать текст и осуществлять простейшее форматирование шрифта.

CourierNew
размер шрифта – 14

MicrosoftWord и StarOfficeWriter имеют широкий спектр возможностей по созданию документов.

BookAntiqua
размер шрифта – 12

Для подготовки к изданию книг, журналов и газет в процессе макетирования издания используются мощные программы обработки текста – настольные издательские системы (например, AdobePageMaker).

MonotypeCorsiva
размер шрифта – 14

Для подготовки к публикации в Интернете Web-страниц и Web-сайтов используются специализированные приложения (например, MicrosoftFrontPage).

Bookman Old Style
размершрифта – 12

Измените цвет предложений и отдельных слов по своему желанию. Сохраните работу в своей папке под именем Практическая работа 1.

Практическое занятие №2 Форматирование абзацев

Цель работы: изучить и освоить возможности MSWord при работе с абзацами.

Прочитайте пояснения,найдите и рассмотрите на экране вкладку Абзац:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Важно уметь различать конец абзаца и конец строки внутри абзаца. Когда текст доходит до правого края листа, он автоматически переходит на новую строку. Когда же Вы нажимаете клавишу , происходит переход к новому абзацу.

Конец абзаца помечается символом ¶. С самого начала приучайтесь работать в режиме включенных скрытых знаков форматирования! Эти символы служат для облегчения работы с текстом и не выводятся на печать.

Задание 1. Выравнивание абзацев

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Существуют четыре способа выравнивания абзацев:

Влево – левый край ровный, а правый как получится.

По центру – весь текст выровнен по центру.

Вправо – правый край ровный, а левый как получится.

По ширине – оба края ровные. Выравнивание по ширине происходит за счет растягивания пробелов между словами.

Внимание! Часто при выравнивании по ширине между словами (если слова длинные) получаются очень большие пробелы. Это некрасиво! Устанавливайте во вкладке РАЗМЕТКА СТРАНИЦЫ Расстановку переносов Авто. Слова будут переносится по слогам автоматически.

Скопируйте напечатанный текст:

Для этого выделите текст (поставьте курсор мыши слева от текста и, удерживая нажатой левую кнопку мыши, ведите курсор мыши вниз, пока весь текст не выделится). Выполните команду Копировать. Копия текста поместилась в буфер обмена, теперь копию текста можно вставлять в указанное место.Через одну строку после набранного текста напечатайте: По центру:

Нажмите и вставьте текст (выполните команду Вставить). Отформатируйте текст по центру (выделите текст и щелкните мышью на пиктограмме по центру).Получится так:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

По правому краю:

Отступите одну пустую строку и вставьте текст (выполните команду Вставить).Отформатируйте текст по правому краю. Получится так:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Отступите одну пустую строку и вставьте текст (выполните команду Вставить). Отформатируйте текст по ширине:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Задание 2. Изменение интервала между строками

Наберите текст по образцу:

Слово «компьютер» означает «вычислитель», т.е. устройство для вычисления. Это связано с тем, что первые компьютеры создавались для вычислений: усовершенствованные автоматические арифмометры.

Выделите текст, скопируйте его и вставьте 3 раза. Между текстами оставляйте пустую строку, чтобы отделить их друг от друга.Затем, выделяя каждый текст, примените к нему соответствующий междустрочный интервал.

Выберите меню Главная Абзац Отступы и интервалы Интервал междустрочный 1,5 строки. Нажмите ОК. Перед каждым текстом напечатайте, какой междустрочный интервал Вы применяете.Получится так:

Междустрочный интервал1,5 строки:

Слово «компьютер» означает «вычислитель», т.е. устройство для вычисления. Это связано с тем, что первые компьютеры создавались для вычислений: усовершенствованные автоматические арифмометры.

Междустрочный интервал Двойной:

Междустрочный интервал Точно 14 пт:

Задание 3. Изменение отступов абзацев

Скопируйте образец текста из Задания 1 и вставьте его 4 раза.

Установим красную строку и заодно поменяем одинарный интервал между строками на 1,5 строки (полуторный) и увеличим интервал между абзацами.Для этого выделите первый текст (2 абзаца), выберите в верхнем меню команду Главная Абзац:

В появившемся окне найдите: первая строка и нажмите на стрелочку вниз, выберите отступ (появится 1,25 см). Установите междустрочный интервал 1,5 строки.Слева интервал перед и после абзаца вместо 0 поставьте 6. Нажмите ОК.Должно получиться так:

Отступ первой строки абзаца:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Остальные образцы текста отформатируйте следующим образом:

Выступ первой строки абзаца:

Абзац является одним из основных объектов текстового документа. Абзац с литературной точки зрения – это часть текста, представляющая собой законченный по смыслу фрагмент произведения, окончание которого служит естественной паузой для перехода к новой мысли.

В компьютерных документах абзацем считается любой текст, заканчивающийся управляющим символом (маркером) конца абзаца. Ввод конца абзаца обеспечивается нажатием клавиши .

Отступ абзацев слева на 3 см:

Отступ абзацев справа на 2 см:

Задание 4. Наберите и отформатируйте текст заявления

Шапка заявления отформатирована по правому краю, слово «Заявление» – по центру, текст заявления – по ширине с красной строкой междустрочный интервал 1,5 строки, дата – по правому краю.

ПКим. П.А. Овчинникова

от обучающегося группы _________

Прошу отпустить меня с уроков 27 декабря 2017 года по семейным обстоятельствам. Заявление от родителей прилагается.

Задание 5. Наберите и отформатируйте текст

Наберите текст по образцу с заданными параметрами форматирования: тип шрифта – Cambria, размер шрифта – 12, междустрочный интервал – одинарный, интервал между четверостишьями до – 6, после – 6; отступ абзацев слева – 4 см или 6 см (через четверостишье).

Внимание! В данном примере каждое четверостишье – это абзац. Для перехода на новую строку внутри абзаца (четверостишья) применяйте принудительный конец строки внутри абзаца – комбинацию клавиш [Shift]+[Enter].

Найдите в Интернете похожую картинку и вставьте ее.

Вечор, ты помнишь, вьюга злилась,
На мутном небе мгла носилась;
Луна, как бледное пятно,
Сквозь тучи мрачные желтела,
И ты печальная сидела —
А нынче. погляди в окно: ¶

Под голубыми небесами
Великолепными коврами,
Блестя на солнце, снег лежит;
Прозрачный лес один чернеет,
И ель сквозь иней зеленеет,
И речка подо льдом блестит. ¶

Сохраните работу в своей папке под именем Практическая работа 2.

Позовите преподавателя для проверки работы

Практическое занятие № 3 Форматирование страницы. Колонки. Списки

Цель работы: изучить и освоить возможности MSWord при работе с колонками и списками.

Задание 1. Установка параметров страницы

Установим поля страницы. Для этого выберите вкладку Разметка страницы Параметры страницы.

Откроется окно Параметры страницы:

Установите поля страницы: Верхнее – 2 см, Нижнее – 2 см, Левое – 2 см, Правое – 2 см.

Обратите внимание, что в этом же окне можно поменять ориентацию страницы с книжной (по умолчанию) на альбомную.

Задание 2. Создание колонок (3 колонки)

Наберите текст по образцу (тип шрифта TimesNewRoman, размер – 12):

Распознавание текстов — очень важная задача, которая возникает во многих областях деятельности человека. Заполняя бюллетень на выборах, бланк во время переписи населения, карточку в поликлинике, бланк теста на экзамене, мы знаем, что обработку информации с этих носителей будет выполнять компьютер, а вернее специальная программа распознавания текста. Но прежде специальное устройство сканер поможет ввести данные с бланков в память компьютера. Сканер предназначен для преобразования информации с бумажного носителя в графический файл, с которым и будет работать программа.

Внимание: после напечатанного абзаца обязательно нажмите несколько раз , иначе не получатся три колонки.

Выделите напечатанный текст и выберите вкладку Разметка страницы Колонки Другие колонки.

Откроется окно Колонки:

Заполните поля диалогового окна: Тип (количество колонок) – 3, промежуток – 0,5 см. Нажмите ОК. Получится так:

Распознавание текстов — очень важная задача, которая возникает во многих областях деятельности человека. Заполняя бюллетень на выборах, бланк во время переписи населения, карточку в поликлинике, бланк теста на экзамене, мы знаем, что обработку информации с этих носителей будет выполнять компьютер, а вернее специальная программа распознавания текста. Но прежде специальное устройство сканер поможет ввести данные с бланков в память компьютера. Сканер предназначен для преобразования информации с бумажного носителя в графический файл, с которым и будет работать программа.

Задание 3. Создание колонок (2 колонки с разделителем)

Скопируйте и вставьте образец текста еще раз. Расположите его в две колонки с интервалом между колонками 1 см, поставьте галочку в окошке Разделитель.Получится так:

Распознавание текстов — очень важная задача, которая возникает во многих областях деятельности человека. Заполняя бюллетень на выборах, бланк во время переписи населения, карточку в поликлинике, бланк теста на экзамене, мы знаем, что обработку информации с этих носителей будет выполнять компьютер, а вернее специальная программа распознавания текста. Но прежде специальное устройство сканер поможет ввести данные с бланков в память компьютера. Сканер предназначен для преобразования информации с бумажного носителя в графический файл, с которым и будет работать программа.

Задание 4. Списки

Списки используют для автоматической нумерации абзацев. Элементом списка может быть только абзац. Списки могут быть нумерованные, маркированные и многоуровневые.

Списки можно создавать двумя способами:

Набрать текст из последовательности абзацев, выделить его и выбрать вид списка.

Выбрать вид списка и только после этого набрать текст из последовательности абзацев.

Читать:
Smart game booster power plan что это

Результат будет одинаковым.

Нумерованные списки

Для создания нумерованного списка выберите вкладку Главная Абзац Нумерация.

Если щелкнуть по стрелке, появится окно, в котором можно выбрать форматы нумерации. Выберите указанный вид нумерованного списка и создайте список:

С айгутина Светлана

Расположите фамилии студенток по алфавиту. Для этого: выделите список и щелкните по пиктограмме Сортировка:

Появится окно Сортировка текста. Нажмите ОК. Получится так:

Скопируйте и вставьте полученный список, выберите другой вид нумерованного списка. Например:

Если список начинается не с 1, а продолжается, выделите первую фамилию, нажмите правую кнопку мыши (контекстное меню) и выберите Начать заново с 1. Создайте другие виды нумерованных списков.

Маркированные списки

Для создания маркированного списка выберите вкладку Главная Абзац Маркеры:

Создайте маркированный список:

Функции процессора:

обработка данных по заданной программе путем выполнения арифметических и логических операций;

программное управление работой устройств компьютера.

Функции памяти:

прием информации из других устройств;

выдача информации по запросу в другие устройства машины.

Многоуровневые списки

Первоначально список не имеет уровней. Для понижения уровня списка следует увеличить отступ:

Распознавание текстов очень важная задача которая возникает

§ 17. Системы перевода и распознавания текстов

Основные темы параграфа:

• как работают программы-переводчики;
• распознавание текста;
• ввод в компьютер печатного и рукописного текста.

В современном мире происходит очень важный процесс — формирование единого информационного пространства. Стираются информационные границы между странами и народами, у человека появляется возможность общаться в буквальном смысле слова со всем миром. Все это приводит к тому, что многие люди различных профессий начинают общаться с иностранными коллегами, читать справочную и другую специальную литературу на иностранном языке. Но далеко не каждый человек свободно владеет иностранными языками.

Современные компьютеры способны хранить большие массивы данных и производить в них быстрый поиск. Эти возможности компьютера можно использовать для создания электронных словарей и организации с их помощью перевода текста с одного языка на другой. Для этих целей сегодня уже существует множество программ.

Как работают программы-переводчики

Чтобы найти перевод неизвестного иностранного слова, пользователю электронного словаря достаточно ввести это слово в строке поиска, и уже через несколько мгновений будет получен исчерпывающий перевод. Современные текстовые процессоры имеют в своем составе словари, позволяющие производить орфографическую проверку правильности написания слов (на разных языках).

Но перевод отдельного слова и перевод целого текста — задачи совершенно разные. Чтобы понять смысл текста, не всегда хватает понимания значений всех входящих в него слов. Например, в английском языке слово «unit» имеет как минимум 6 различных значений. Какое из них имел в виду автор конкретного текста? Следствием необходимости решения этих проблем стало появление компьютерных систем перевода текстов. Современные системы перевода позволяют не только переводить, но и редактировать перевод, работать с различными тематическими словарями, выполнять как простой и быстрый, так и сложный и профессиональный перевод. Эти программы (вернее, пакеты программ) позволяют работать с файлами различных типов, электронной почтой, гипертекстовыми документами и т. п. К сожалению, задача адекватного перевода до конца еще не решена — многие программы зачастую выполняют ее не всегда удачно.

Рассмотрим простой пример. Переведем с помощью системы перевода на английский язык фразу:

Информатика — это наука об информации.

The computer science is an information science.

А теперь с помощью той же программы переведем эту фразу на русский язык. Получим:

Информатика — информатика.

Как говорится, почувствуйте разницу!

Системы перевода еще уступают человеку, особенно в работе с художественными текстами, но эта область информатики развивается очень быстро и «электронные карманные переводчики» уже становятся незаменимым помощником туриста, отправляющегося в страну с незнакомым для него языком.

Распознавание текста

Перед обсуждением этой темы давайте вспомним, какие устройства ввода информации существуют у современных компьютеров? Клавиатура, мышь, сканер и др. Сканер, например, позволяет вводить графическую информацию с листа бумаги.

За сотни лет человечество накопило огромный объем информации на традиционных бумажных носителях (книгах, газетах, журналах и т. п.). В настоящее время существует потребность (у электронных библиотек, к примеру) переносить эту информацию в память компьютера. Конечно, это можно сделать с помощью клавиатуры и текстового редактора, но, представьте себе, сколько времени уйдет даже у профессионального оператора на ввод, скажем, романа «Война и мир»? Необходимо как-то ускорить этот процесс. Встает вопрос, нельзя ли использовать сканер для ввода текстовой информации? Правда, в этом случае возникает такая проблема: все, что введено с помощью сканера, хранится в памяти ЭВМ как изображение. Надо «объяснить» компьютеру, что значок «с» — не просто закорючка, а буква, и хранить и обрабатывать его нужно как букву.

Ввод в компьютер печатного и рукописного текста

Существуют программы, позволяющие вводить тексты в ПК с помощью сканера. Используя специальные алгоритмы, они распознают буквы, позволяют редактировать распознанный текст и сохранять его в различных форматах. Популярной программой такого типа является АВВY FineReader. Работать с этой программой несложно. Сначала нужно отсканировать текст (управлять сканером можно прямо в среде (FineReader), затем разбить этот текст на фрагменты, потом распознать эти фрагменты, отредактировать полученный текст и, наконец, сохранить его в нужном текстовом формате. Интерфейс программы позволяет освоить эти операции легко и быстро.

Задача распознавания текста относится к области проблем, которые решает наука под названием «Искусственный интеллект». Современные распознающие программы умеют читать не только печатный текст, но и текст, написанный самым «корявым» почерком.

Коротко о главном

Современные программные средства позволяют переводить тексты с одного языка на другой и распознавать их, переводя из отсканированного графического представления в текстовые файлы.

Вопросы и задания

1. Что такое электронные словари?
2. Какие дополнительные проблемы возникают при переводе текстов? Что отличает систему перевода текста от электронного словаря?
3. Почему отсканированный текст нельзя сразу обрабатывать текстовым редактором?
4. В чем состоит проблема распознавания текста?

Чему вы должны научиться, изучив главу 3

• Набирать текст в одном из текстовых редакторов.
• Выполнять основные операции над текстом, допускаемые этим редактором.
• Сохранять текст на диске, загружать его с диска, выводить на печать.

И. Семакин, Л. Залогова, С. Русаков, Л. Шестакова, Информатика, 8 класс
Отослано читателями из интернет-сайтов

Планы уроков информатики, скачать тесты бесплатно, всё для учителя и школьника в подготовке к уроку по информатике 8 класс, домашние задания, вопросы и ответы

Если у вас есть исправления или предложения к данному уроку, напишите нам.

Если вы хотите увидеть другие корректировки и пожелания к урокам, смотрите здесь — Образовательный форум.

Программа обнаружения и выделения текста

Распознавание текста на изображениях как очень важная задача, имеющая множество практических приложений. Особенности архитектуры интегрированной системы получения текстовой информации из изображений. Общая характеристика методов выделения текста.

Рубрика Программирование, компьютеры и кибернетика
Предмет Программирование
Вид курсовая работа
Язык русский
Прислал(а) alesandra
Дата добавления 12.06.2016
Размер файла 1,7 M

Отправить свою хорошую работу в базу знаний просто. Используйте форму, расположенную ниже

Студенты, аспиранты, молодые ученые, использующие базу знаний в своей учебе и работе, будут вам очень благодарны.

Подобные документы

Необходимость в системах распознавания символов. Виды сканеров и их характеристики. Оптимальное разрешение при сканировании. Программы распознавания текста. Получение электронного документа. FineReader — система оптического распознавания текстов.

презентация [469,2 K], добавлен 15.03.2015

Порядок и основные правила создания и редактирования текста. Способы выделения текста. Исправление орфографических ошибок с помощью функции автоматической проверки правописания в тестовом редакторе Word. Присвоение имя файлу и его сохранение в программе.

лабораторная работа [116,5 K], добавлен 04.12.2010

Оптическое распознавание символов как механический или электронный перевод изображений рукописного, машинописного или печатного текста в последовательность кодов. Компьютерные программы для оптического распознавания символов и их характеристика.

презентация [855,2 K], добавлен 20.12.2011

Работа в окне документа. Ввод текста. Вставка и удаление текста. Отмена результатов выполненных действий. Перемещение и копирование текста методом «перетащить-оставить». Форматирование текста. Сохранение документа. Шаг вперед: смена регистра.

лабораторная работа [220,9 K], добавлен 10.03.2007

Классификация текстовых редакторов и процессоров. Способы хранения текста в файле. Форматирование документа и его редактирование. Среда текстового редактора. Автоматическая проверка орфографии и синтаксиса текста, автотекст, автозамена, гипертекст.

курсовая работа [35,0 K], добавлен 25.04.2013

Основные компоненты создания текста. Использование текстовых эффектов, редактирование изображений в растровом редакторе Adobe Photoshop. Работа с простым текстом. Создание объемного и сверкающего текстов, теней, огненной, ледяной и золотой надписей.

лабораторная работа [648,4 K], добавлен 18.10.2012

Кодирование информации в двоичном коде. Разработка приложения, реализующего следующее преобразование текста: каждая буква исходного текста заменяется третьей после нее буквой в алфавите, который считается написанным по кругу. Алгоритм работы программы.

Распознавание текста на изображении

Распознавание текста на изображениях (оптическое распознавание символов (англ. optical character recognition, OCR [1] )) — одно из направлений распознавания образов, задача которого заключается в переводе изображений рукописного, машинного или печатного текста в текстовые данные, использующиеся для представления символов в компьютере (например, в текстовом редакторе).

Содержание

Общая информация

Распознавание текста на изображениях является важной задачей машинного обучения, так как это позволяет организовать удобное взаимодействие с данными: редактирование, анализ, поиск слов или фраз и т.д.

В последние десятилетия, благодаря использованию современных достижений компьютерных технологий, были развиты новые методы обработки изображений и распознавания образов, благодаря чему стало возможным создание таких промышленных систем распознавания печатного текста, как, например, FineReader [2] , которые удовлетворяют основным требованиям систем автоматизации документооборота.

Тем не менее, создание приложения в данной области по-прежнему остается творческой задачей и требует дополнительных исследований в связи со специфическими требованиями по разрешению, быстродействию, надежности распознавания и объему памяти, которыми характеризуется каждая конкретная задача.

История

Разработка OCR-систем основана на технологиях, связанных с телеграфией и созданием считывающих устройств для слепых. В 1914 году Эммануэль Гольдберг разработал устройство, считывающее символы и преобразовывающее их в стандартный телеграфный код. Одновременно Эдмунд Фурнье д’Альбе разработал «Оптофон», ручной сканер, который, при перемещении по напечатанной странице, вырабатывал тональные сигналы, соответствующие определенным буквам или символам.

В 1974 году Рэй Курцвейл создал компанию «Kurzweil Computer Products, Inc» и начал работать над развитием первой системы оптического распознавания символов, способной распознавать текст, напечатанный любым шрифтом. Курцвейл считал, что лучшее применение этой технологии — создание машины чтения для слепых, которая позволила бы слепым людям иметь компьютер, умеющий читать текст вслух. Данное устройство требовало изобретения сразу двух технологий — ПЗС (прибор с зарядовой связью [3] ) планшетного сканера и синтезатора, преобразующего текст в речь.

Первой коммерчески успешной программой, распознающей кириллицу, стала программа «AutoR» российской компании «ОКРУС». Алгоритм «AutoR» был компактный, быстрый и шрифтонезависимый. Этот алгоритм разработали и испытали ещё в конце 60-х два молодых биофизика, выпускники МФТИ — Г. М. Зенкин и А. П. Петров. В настоящее время алгоритм Зенкина-Петрова применяется в нескольких прикладных системах, решающих задачу распознавания графических символов.

В 1993 году вышла технология распознавания текстов российской компании ABBYY. На её основе создан ряд корпоративных решений и программ для массовых пользователей. Технологии распознавания текстов ABBYY OCR лицензируют международные ИТ-компании, такие как Fujitsu, Panasonic, Xerox, Samsung, EMC и другие.

В 2000-х годах производительность и компактность OCR-системы позволила представить на рынок онлайн-сервисы по переводу текста с одного языка на другой. Со временем такие программы получили возможность обрабатывать изображения как печатного, так и рукописного текста.

С развитием технологий производства мобильных устройств и упрощения процесса разработки мобильных приложений, OCR-системы стали неотъемлемой частью разнообразных программ: от развлекательных до обучающих, от мобильных помощников до систем управления.

Применение систем распознавания текстов

Системы OCR применяются во многих областях. Вот некоторые из задач, которые решают системы распознавания текстов:

  • Считывание данных с бланков и анкет.
  • Автоматическое распознавание номерного знака.
  • Распознавание паспортных данных.
  • Извлечение информации из визитных карточек в список контактов.
  • Создание цифровых версий печатных и рукописных документов, например, сканирование книг для проекта «Гутенберг» [4] .
  • Технология для помощи слепым и слабовидящим.

Наиболее распространенные задачи OCR

С задачей распознавания символов связаны следующие проблемы:

  • Разнообразие форм начертания символов: документ может содержать несколько шрифтов сразу, а символы могут быть схожи по начертанию.
  • Искажение изображения, содержащего текст:
    • Шумы при печати.
    • Плохое качество изображения (засвеченность, размытость).

    Процесс распознавания текста

    Система распознавания текста предполагает наличие на входе изображения с текстом (в формате данных графического файла). На выходе система должна выдать текст, выделенный из входных данных. Весь процесс распознавания текста состоит из нескольких задач.

    Обработка изображения

    Перед началом распознавания текста изображение должно быть очищено от шума и приведено к виду, позволяющему эффективно выделять символы и распознавать их. Обычно у изображения повышают резкость, контрастность, выравнивают его и преобразовывают в используемый системой формат (например, 8-битное изображение в градациях серого).

    Распознавание символов

    ДОБАВИТЬ ОБЩИЕ СЛОВА

    Алгоритмы распознавания символов

    Распознавание при помощи метрик

    Этой способ лучше всего работает с машинописным текстом, но при обработке новых шрифтов точность распознавания падает. Метрика является признаком символа, поэтому иногда в контексте данного способа говорят о процессе выявления признаков. В качестве метрики используют расстояние Хэмминга, которое показывает, на сколько пикселей различаются изображения. Если признаки двух символов максимально похожи, то разность между их метриками (то есть расстояние между ними) стремится к нулю. Дальнейшая классификация символа происходит по методу ближайшего соседа.

    Однако, одной метрики недостаточно для распознавания символа, так как некоторые очень похожи между собой, (например, “j” и “i”, “Z” и “2”) что может привести к ошибке. Для избежания этого, используют следующие техники:

    1) Группировка символов
    $\;$Некоторые символы (“O”, “H”, “I”) обладают суперсимметрией, (полностью совпадают со своими отражениями, значимые пиксели распределены равномерно по всему изображению) и их можно выделить в отдельный класс. Это значительно сокращает перебор метрик.

    2) Контекстное распознавание
    $\;$В качестве помощи алгоритмам распознавания в систему включают словари. Они предоставляют справки во многих случаях, но быстро отказывают, когда, например, имеют дело с именами собственными, которые не находятся в словаре.

    Распознавание с применением нейронных сетей

    Нейронные сети – это структура связанных элементов, на которых заданы функции преобразования сигнала, а также коэффициенты, которые могут быть настроены на определенный характер работы.

    Часть элементов структуры выделены как входные: на них поступают сигналы извне, таким образом, они описывают значения пикселя изображения. То есть, если имеется изображение 16х16, входов у сети должно быть 256. Другая часть – выходные, они формируют результирующие сигналы.

    Сигнал, проходящий через нейронную сеть, преобразуется согласно формулам на элементах сети, на выходе формируется ответ. Так как все нейроны поименованы значениями букв, следовательно, среагировавший нейрон и несет ответ распознавания.

    Нейронная сеть может быть использована в системе распознавания текста в качестве классификатора. При обучении, сеть получает на вход изображения, анализирует все позиции черных пикселей и выравнивает коэффициенты, минимизируя ошибку. Таким образом, достигается лучший результат распознавания.

    Пример нейронной сети

    На картинке в качестве примера схематически показана двухслойная нейронная сеть, включающая в себя 35 входов (каждый символ — матрица 7×5, соответственно, вектор, описывающий матрицу, состоит из 35 элементов), 26 выходов (количество букв) и 10 нейронов скрытого слоя. В качестве функции активации в данной сети используется сигмоидная функция [5] , выход которой представлен в диапазоне от 0 до 1, что потом удобно перевести в булеву алгебру.

    Пример на синтаксисе скриптового языка MATLAB
    Недостатки нейронных сетей

    Нейронные сети с успехом могут применяться в системах распознавания текста, однако обладают существенными недостатками, препятствующими их широкому применению:

    • Затраты памяти: необходимо построить достаточно большую сеть элементов, что приводит к большим затратам памяти.
    • Затраты ресурсов системы: в процессе распознавания используются большие объемы ресурсов системы, так как функции на элементах сети работают с числами с плавающей точкой.
    • Необходимость в обучении: для достижения более точного результата нейронную сеть необходимо обучать, однако и это не гарантирует идеальный результат.
    • Сложность построения: так как работа нейронной сети во многом зависит от ее конфигурации, требуется больше усилий для создания наиболее эффективной архитектуры.

    Алгоритмы распознавания текста

    E2E-MLT

    Определение:
    E2E-MLT [6] — метод, позволяющий решать задачи локализации и распознавания текста на изображениях, содержащих фрагменты на разных языках. Основан на FCN-сети с общими слоями для обеих задач.

    Реализация размещена в Github репозитории [7] одного из авторов проекта.

Похожие статьи