Главная страница
    Top.Mail.Ru    Яндекс.Метрика
Форум: "Прочее";
Текущий архив: 2010.08.27;
Скачать: [xml.tar.bz2];

Вниз

Сопоставление текста и отсканированного текста   Найти похожие ветки 

 
AK-47   (2010-05-11 13:52) [0]

Есть текст, состоящий из абзацев. Абзацы могут быть выровнены по левому краю, по правому, по центру или по ширине. В тексте могут быть таблицы из псевдографики.
Еще есть отсканированные страницы, практически того же текста. Отличие может быть в оформлении, то есть абзацы могут быть выровненные по другому, регистр некоторых слов может не совпадать, некоторые абзацы могут быть разбиты на несколько или наоборот склеены.
Задача состоит в том, что зная позицию в тексте нужно найти соответствующую позицию в отсканированном тексте (номер отсканированной страницы и примерные координаты области) и наоборот.

Первое, что приходит на ум - это распознать отсканированный текст и его уже сравнивать с обычным текстом, но боюсь это довольно сложно сделать. Может быть есть идеи как решить эту задачу другими способами?
Был бы рад их услышать


 
12 ©   (2010-05-11 14:02) [1]

1. среднее заполнение символов
2. вспомогательные контрольные точки


 
cyber-pilot   (2010-05-11 14:10) [2]

> 1. среднее заполнение символов
Непонятно как это использовать, можете подробнее пояснить?

> 2. вспомогательные контрольные точки
В качестве контрольных точек наверное можно использовать таблицы и еще можно воспользоваться выравниванием абзацев (в большинстве случаев выравнивание совпадает). Других контрольных точек пока не вижу.


 
12 ©   (2010-05-11 17:11) [3]

ну, это навскидку, что пришло в голову
1. Прикинуть, сколько символов на страницу выходит. В зависимости от символа в тексте, вычислять его вероятностное нахождение на картинке

пусть 500 символов страница, в среднем. 20 страниц.
тогда 3444й символ где-то в конце 7ой страницы

2.
Тоже самое, что и 1, на самом деле,
тока запоминаем, номера символов в начале каждой страницы. Можно еще и в конце, середине.
Тогда 3444й символ - отнять неотрицательно контрольную точку..



Страницы: 1 вся ветка

Форум: "Прочее";
Текущий архив: 2010.08.27;
Скачать: [xml.tar.bz2];

Наверх




Память: 0.45 MB
Время: 0.06 c
15-1274395088
Германн
2010-05-21 02:38
2010.08.27
Почему свойство Pages у TPageControl readonly?


15-1275547795
Sergey Masloff
2010-06-03 10:49
2010.08.27
Электронные книжки - что купить


15-1275251381
Юрий
2010-05-31 00:29
2010.08.27
С днем рождения ! 31 мая 2010 понедельник


15-1265999141
OneYoungMan
2010-02-12 21:25
2010.08.27
Linux для старого компьютера...


15-1265369204
Тайлер Дерден
2010-02-05 14:26
2010.08.27
1С, терминальный сервер и печать





Afrikaans Albanian Arabic Armenian Azerbaijani Basque Belarusian Bulgarian Catalan Chinese (Simplified) Chinese (Traditional) Croatian Czech Danish Dutch English Estonian Filipino Finnish French
Galician Georgian German Greek Haitian Creole Hebrew Hindi Hungarian Icelandic Indonesian Irish Italian Japanese Korean Latvian Lithuanian Macedonian Malay Maltese Norwegian
Persian Polish Portuguese Romanian Russian Serbian Slovak Slovenian Spanish Swahili Swedish Thai Turkish Ukrainian Urdu Vietnamese Welsh Yiddish Bengali Bosnian
Cebuano Esperanto Gujarati Hausa Hmong Igbo Javanese Kannada Khmer Lao Latin Maori Marathi Mongolian Nepali Punjabi Somali Tamil Telugu Yoruba
Zulu
Английский Французский Немецкий Итальянский Португальский Русский Испанский