Главная страница
Top.Mail.Ru    Яндекс.Метрика
Текущий архив: 2010.08.27;
Скачать: CL | DM;

Вниз

Сопоставление текста и отсканированного текста   Найти похожие ветки 

 
AK-47   (2010-05-11 13:52) [0]

Есть текст, состоящий из абзацев. Абзацы могут быть выровнены по левому краю, по правому, по центру или по ширине. В тексте могут быть таблицы из псевдографики.
Еще есть отсканированные страницы, практически того же текста. Отличие может быть в оформлении, то есть абзацы могут быть выровненные по другому, регистр некоторых слов может не совпадать, некоторые абзацы могут быть разбиты на несколько или наоборот склеены.
Задача состоит в том, что зная позицию в тексте нужно найти соответствующую позицию в отсканированном тексте (номер отсканированной страницы и примерные координаты области) и наоборот.

Первое, что приходит на ум - это распознать отсканированный текст и его уже сравнивать с обычным текстом, но боюсь это довольно сложно сделать. Может быть есть идеи как решить эту задачу другими способами?
Был бы рад их услышать


 
12 ©   (2010-05-11 14:02) [1]

1. среднее заполнение символов
2. вспомогательные контрольные точки


 
cyber-pilot   (2010-05-11 14:10) [2]

> 1. среднее заполнение символов
Непонятно как это использовать, можете подробнее пояснить?

> 2. вспомогательные контрольные точки
В качестве контрольных точек наверное можно использовать таблицы и еще можно воспользоваться выравниванием абзацев (в большинстве случаев выравнивание совпадает). Других контрольных точек пока не вижу.


 
12 ©   (2010-05-11 17:11) [3]

ну, это навскидку, что пришло в голову
1. Прикинуть, сколько символов на страницу выходит. В зависимости от символа в тексте, вычислять его вероятностное нахождение на картинке

пусть 500 символов страница, в среднем. 20 страниц.
тогда 3444й символ где-то в конце 7ой страницы

2.
Тоже самое, что и 1, на самом деле,
тока запоминаем, номера символов в начале каждой страницы. Можно еще и в конце, середине.
Тогда 3444й символ - отнять неотрицательно контрольную точку..



Страницы: 1 вся ветка

Текущий архив: 2010.08.27;
Скачать: CL | DM;

Наверх




Память: 0.47 MB
Время: 0.164 c
15-1268329391
Ega23
2010-03-11 20:43
2010.08.27
Ололо предлагают послать на Евровидение


15-1273672717
istok
2010-05-12 17:58
2010.08.27
посоветуйте компоненты для DashBoard...


15-1266095159
Peace of cake
2010-02-14 00:05
2010.08.27
Как работает функция Ord?


2-1274878317
Delphist2
2010-05-26 16:51
2010.08.27
копирование из spinedit


2-1272893024
Сава. Ж
2010-05-03 17:23
2010.08.27
Подскажите компонент для выделения любой области?