Вы здесьПроблемы и приемы OCR: dewarp
Опубликовано ср, 06/05/2009 - 04:06 пользователем Ulenspiegel
Если при сканировании книжка не прижата плотно к предметному стеклу, участки строк, находящиеся вблизи разворота, искривляются. При сильном искривлении (заползание на уровень соседней строки) программы распознавания приходят от таких червячков в недоумение. Не знает ли всемогущий All алгоритмов и (что еще лучше) готовых программ для борьбы с таким безобразием ?
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Telly RE:Подайте бедному копеечку на книжку с литреса... 2 часа
Саша из Киева RE:Как приобретать друзей и оказывать влияние на людей 2 дня Isais RE:Семейственность в литературе 5 дней miri.ness_ RE:Доступ 27 1 неделя bmusanov Оплатил, но абонемент не отображается 1 неделя holla RE:Багрепорт - 2 1 неделя sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 неделя konst1 RE:Файнридер для Win11 1 неделя larin RE:Оплатил, но абонемент не отображается 2 недели sem14 RE:Книжная серия «Сlio» издательства "Евразия" 2 недели Isais RE:Национальный конкурс на лучшее литературное произведение... 2 недели Isais RE:Детство, опаленное войной (Вторая мировая 1939-1945 и ВОВ) 2 недели sem14 RE:Современная корейская литература. Книжная серия... 2 недели sem14 RE:«Морской роман» — книжная серия Калининградского книжного... 2 недели larin RE:Оплатил,но абонемент не отображается 2 недели sd RE:Fishing 3 недели Алексей111111111111 RE:Оплатила,но абонемент не отображается 3 недели kopak RE:Беженцы с Флибусты 4 недели Впечатления о книгах
commodore про Севинье: Письма (Историческая проза, Эпистолярная проза)
14 08 Дай Бог здоровья тебе, мил человек, выложивший эту книгу!
Vened про Ангелов: Унылый плагиатор Майки Гельприн (Публицистика, Сатира)
14 08 Откровенный хлам. Всей серии место на мусорке, а не в библиотеке. Оценка: нечитаемо
Sello про Мережковский: Воскресшие боги, или Леонардо да Винчи (Историческая проза)
13 08 Роман, второй, входящий в трилогию "Христос и Антихрист". Не складываются у меня отношения с Мережковским. Материалом автор обладал огромным. Но вот такое чувство, что, знаниями переполненный, он позабыл придать им, чтобы ……… Оценка: неплохо
pulochka про Михалкова: Котов обижать не рекомендуется (Дамский детективный роман)
13 08 Господи !Что это было? Страшно затянуто и нудно. Жвачка ужасная! Набор выдернутых фраз из популярных советских фильмов. Сюжет, похож на сломанную марионетку то заваливается то налево то направо, рваный и нелепый. Начало ……… Оценка: нечитаемо
Oleg68 про Бассо: Призрак пера [litres] (Иронический детектив)
13 08 Типичный дамский детектив с приправой литературы. Достаточно интересно. Оценка: хорошо
Stanislaw Wartownik про Коэльо: Победитель остается один [O Vencedor Está Só ru] (Современная проза)
13 08 Бредовая натужная чушь. Даже не дочитал это унылое г. Оценка: нечитаемо
lokiiii про Михайлов: Инфер-10 (Боевая фантастика, Киберпанк, Постапокалипсис, Самиздат, сетевая литература)
12 08 Оди ушел в конце восьмой книги, а не девятой. И на этом подцикл Инфер, по сути, завершен. Начиная с девятой (где и описано куда подевался его экз) книги идёт уже новый подцикл, для которого автору просто было лень придумывать ……… Оценка: хорошо
Синявский про Евгений Львович Чижов
11 08 11 авг - РИА Новости. Писатель Евгений Чижов утонул в Балтийском море, сообщил его друг, писатель Дмитрий Данилов.
decim про Астраби: Сумма наших жизней (Современная проза)
11 08 Дамский роман с психологией. На копейку сложнее стандартного "арлекина", но и только. Годится для чтения в зале ожидания или вагоне. Неплохо. Оценка: неплохо
dolle про Михайлов: Инфер-10 (Боевая фантастика, Киберпанк, Постапокалипсис, Самиздат, сетевая литература)
10 08 Оди опять вернулся. Без нейроимплантов и прочих " плюшек" он скрывается от матери. Новый сюжет, новые локации и интрига в конце книги.
udrees про Михайлов: Инфер-10 (Боевая фантастика, Киберпанк, Постапокалипсис, Самиздат, сетевая литература)
10 08 Я думал история Оди завершилась вполне логично в 9-й книге, ан-нет, триумфальное возвращение гоблина. Правда там не объясняется, откуда он выполз и куда подевался его экзо-костюм Ночная гадюка. Помнится в 9-й книге он в нем ……… Оценка: отлично!
udrees про Докинз: Бог как иллюзия [The God Delusion ru] (Религиоведение, Философия)
10 08 Очень познавательная книга, исследующая возникновение и пользу религии в жизни человека. Мне в общем-то понравилось, как автор раскладывает по полочкам основные моменты того, как религия влияет на нашу жизнь, рассматривает ……… Оценка: отлично! |
Комментарии
Отв: Проблемы и приемы OCR: dewarp
Насчет алгоритмов не знаю (хотя Файнридер вроде что то делает) но как вариант решения за $500 смотри тут: http://lib.rus.ec/node/131676
Отв: Проблемы и приемы OCR: dewarp
Э нет, кривой скан в данном случае - уже данность :( В смысле - готовый DJVU
Отв: Проблемы и приемы OCR: dewarp
В FineReader 8, которым я пользуюсь, в настройках "1. Сканировать/открыть" есть опция "Устранить искажение строк". Очень даже помогает.
В 9-й версии наверняка тоже есть.
Отв: Проблемы и приемы OCR: dewarp
Есть , "streighten lines" и "desкew" - кто из них кто уже не помню за ненадобностью.
можно на страницу провести операцию а можно применить ко всем , но я бы советовал постранично ибо некоторые страницы наоборот как раз портит.
Отв: Проблемы и приемы OCR: dewarp
Да вы чего, издеваетесь, панове ?! deskew - есть, это исправление перекоса (когда книжку положили непараллельно границам окна),
Отв: Проблемы и приемы OCR: dewarp
deskew - это совсем из другой оперы.
Возьмите ложку. Положите ее на стол под уголм 45градусов к краю. Исправьте положение ложки. А теперь СОГНИТЕ ложку поплам и попрубуйте исправить перекос относительно края тем же способом
Отв: Проблемы и приемы OCR: dewarp
В моем случае ложка выглядит примерно так: Я думал, что это именно warp
Отв: Проблемы и приемы OCR: dewarp
Я не издеваюсь , я же сказал что не помню, значит не deskew а второй - staighten text lines:
Отв: Проблемы и приемы OCR: dewarp
Теоретически в 8 и 9 Файнридерах имеется встроенный механизм коррекции:
На практике, выработанной на 4м ещё файнридере, лучшим удалителем искажений в зоне разворота служит левая рука, прижимающая книгу к сканеру в момент сканирования... :)
...Каких либо отдельных программ, позволяющих выпрямлять строки я никогда не встречал. Теоретически это можно проделать в фотошопе, но... страницу, пусть две. А сотню? Сомневаюсь.
Отв: Проблемы и приемы OCR: dewarp
АААА!!!! Спасибо, Jolly Roger - ака, и вправду есть! Они его спрятали неочевидным образом.
Если кто-нибудь еще на эти грабли наступит, тулза работает и выглядит вот так:
Отв: Проблемы и приемы OCR: dewarp
Дык а я о чем ?
Отв: Проблемы и приемы OCR: dewarp
Виноват, подумал, что она в опциях сканирования сидит.
Отв: Проблемы и приемы OCR: dewarp
Вроде бы именно такие искривления исправляет Book Restorer. Подробности на ru-board.
Отв: Спасибо!
Век живи - век учись... Действительно, есть и отдельная программа под задачу:
http://djvu-soft.narod.ru/scan/curved_text.htm
...как я понимаю, у неё настроек побогаче будет. Видимо, для сложных случаев может оказаться предпочтительней.
Отв: Проблемы и приемы OCR: dewarp
На сорсфорже была утилитка unpaper - она, кажется, умела автоматически делать обработку сканированных страниц, выравнивая картинки, зачищая поля и выравнивая интенсивность фона. Заодно резала на страницы, если сканировался разворот.
Отв: Проблемы и приемы OCR: dewarp
http://unpaper.berlios.de
А строки, AFAIK, не ровняет.
Но вобщем ничего, пользуюсь периодически.
Отв: Проблемы и приемы OCR: dewarp
Если нужно подготовить скан для создания дежавю, то лучше выпрямить строки программой BookRestorer. Там же можно сделать все остальное (чистка, обрезка и т. д.)
Отв: Проблемы и приемы OCR: dewarp
Покажите, плз, мне нормально выпрямленные букресторером строки
Я пробовал это делалать, у меня не получилось. У моих знакомых по ру-боарду тоже.
Отв: Проблемы и приемы OCR: dewarp
Показать в буквальном смысле не могу, т. к. не сохраняю исходники во-первых, и не помню какие именно строки были выпрямленыв во-вторых. Но этой функцией пользовался не раз и не два. Настройки дефолтные. Правда, изгиб касался максимум 3-4 строк внизу страницы. Обычно все же стараюсь прижимать книгу к сканеру :) Совсем уж бракованный скан проще переснять, чем маяться с ним.