Что делать с книгами, в которых нет текстового слоя
Опубликовано чт, 17/12/2009 - 21:38 пользователем Zadd
Forums: Ситуация такая: есть книги в форматах DJVU и PDF, картинок нет, только текст, НО этот текст закодирован в виде картинок
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Океана RE:Подайте бедному копеечку на книжку с литреса... 1 час
Larisa_F RE:«Юмористическая серия» 1 день Larisa_F RE:Собираем серию: "Азбука-триллер", издательство "Азбука-Терра" 1 день Larisa_F RE:Серия "Символы времени" издательства "Аграф" 1 день larin RE:Оплатил, но абонемент не отображается 3 дня nehug@cheaphub.net RE:DNS 1 неделя alexk RE:Багрепорт - 2 1 неделя sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 2 недели Isais RE:Семейственность в литературе 2 недели Violontan RE:Жан Батист Мольер воскрешенный 2 недели sem14 RE:Гонкуровская премия 3 недели Dead_Space RE:Беженцы с Флибусты 3 недели Саша из Киева RE:Приключения белочки Рыжки 1 месяц alex-from RE:Оплатил два раза, но абонемента нет 1 месяц Kiesza RE:На 78-м году жизни скончался советский и российский... 1 месяц Paul von Sokolovski RE:Бушков умер. 1 месяц lemma7 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 1 месяц Isais RE:Издательство "Медуза" 1 месяц Впечатления о книгах
Iron Man про Гессен: Во глубине сибирских руд... (Биографии и Мемуары)
15 12 Восхитило содержание узников "кровавого царизма": «В Чите рудников не было. Здесь работа была другая, более легкая: декабристы чистили казенные хлевы и конюшни, подметали улицы, копали рвы и канавы, строили дороги, мололи ………
mysevra про Каку: Физика невозможного [Physics of the Impossible: A Scientific Exploration into the World of Phasers, Force Fields, Teleportation, and Time Travel ru] (Физика, Научпоп)
15 12 Читается легко, как художественное произведение. Автор – настоящий энтузиаст своего дела, способный объяснить сложные теории простым языком. Самое замечательное то, что книга написана не сегодня и уже многие «предсказанные» ……… Оценка: отлично!
mysevra про Балашова: Фатальное прикосновение (Исторический детектив)
15 12 Начало довольно бодрое, а потом увязли в подробностях и отступлениях. Оценка: неплохо
mysevra про Лондон: Великий кудесник [The Master of Mystery ru] (Классическая проза ХX века)
15 12 Сурово так: методы воспитания детей, способы экзорцизма, да и плата за чудеса. Мне понравилось. Оценка: отлично!
nik_ol про Донцова: Дочь Скупого Клопа (Иронический детектив, Дамский детективный роман)
14 12 Спасибо огромное, что выложили наконец-то! Чмоки) Оценка: хорошо
Kromanion про Лагин: Старик Хоттабыч [litres] (Советская классическая проза, Сказка)
14 12 Старик Хоттабыч почти целиком спижжен с Энсти "Медный кувшин", и отличается лишь противоестественными "острополитическими" вставками, которые, видимо Лагин менял согласно флюгеру внешнеполитического курса. Сами вставки инородны ………
Никос Костакис про Вячеслав Солдатенко (Слава Сэ)
14 12 Я больше классиков люблю: Лёву Тэ или Федю Дэ...
Никос Костакис про Калмыков: На пути «Тайфуна» [СИ] (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
12 12 Ни один нормальный человек не поверит, что убийцам и грабителям могут дать в руки оружие. И уж тем более, ни одно правительство не пойдет на такой шаг". __________________________ Ну да, ну да...
Isais про Плещеева: Батареи Магнусхольма (Исторический детектив, Шпионский детектив)
11 12 Хотя мне давно отвратительно откровенное имперство автора, перетекающее в путинославие, не могу не признать — исторические детективы у нее получаются. И исторические лучше, чем детективы, потому что детективы у нее случаются ……… Оценка: хорошо
123_abc про Вадим Юрьевич Панов
10 12 Аркада. Вся трилогия с оценкой "отлично". А с учетом времени её написания ещё и "плюс" сверху. Оценка: отлично с плюсом
vvv про Алмазов: Гений Медицины (Героическая фантастика, Городское фэнтези, Попаданцы, Самиздат, сетевая литература)
10 12 Медицинская часть интересна. Но остальное... Создается впечатления, что основной целью авторов было показать на примере персонажей, как развитие магии способствует деградации интеллекта.
Лысенко Владимир Андреевич про Земляной: Мастер стихий 3 [СИ] (Боевая фантастика, Технофэнтези, Самиздат, сетевая литература)
10 12 Книга понравилась, читается легко, хотелось бы продолжения. Оценка: отлично! |
Отв: Что делать с книгами, в которых нет текстового слоя
?
Отв: Что делать с книгами, в которых нет текстового слоя
А списочек книжек (желательно со ссылками на файлообменники и т.п.) можно? А то ведь может кто (в том числе и я) заинтересуется и OCR-ить поможет?
Отв: Что делать с книгами, в которых нет текстового слоя
http://depositfiles.com/files/kon5m6qr1
http://depositfiles.com/files/t5np6gf08
моя Опера на эти ссылки показывает,будто они неправильные, но переходит по ним нормально.
Я в этих ссылках применил технологию для быстрого скачивания с депозита и летитбита:
если слева от ссылки в браузере на файл депозита или летитбита приставить "sfrom.net/" то файл будет скачан на полной скорости.
Такие ссылки я и написал сначала, но не учел, что ссылки расположены не в командной строке браузера, а на сервере Либрусека, соответственно sfrom.net тоже искался на Либрусеке. Тогда я приставил к адресам ещё один начальный http и все заработало!
Ссылки теперь ведут на быструю скачку файлов с депозита на полной скорости через sfrom.net(видимо у них есть Голд-аккаунты на депозите и летитбите, а вот на Рапиде нету)
Отв: Что делать с книгами, в которых нет текстового слоя
Перевести в джипеги и сделать OCR.
Отв: Что делать с книгами, в которых нет текстового слоя
Технологию процесса - в студию !!!
Отв: Что делать с книгами, в которых нет текстового слоя
"Переконвертить" нельзя. Нужно распознать текст так, как мы распознаем отсканированные картинки.
Нет, не поможет. Поможет только OCR. Переводить в джипеги не нужно, Файнридер (по крайней мере, последние его версии) прекрасно понимает pdf.
Отв: Что делать с книгами, в которых нет текстового слоя
И дежавю тоже ФР понимает. С 9 версии.
Вообще, забавный товарищ.
Как он себе представляет, книги (в виде текстов) в сеть попадают?
Тетеньки машинистки перепечатывают? )))
Отв: Что делать с книгами, в которых нет текстового слоя
Мой девятый не распознаёт. Приходится переводить в PDF.
Отв: Что делать с книгами, в которых нет текстового слоя
Это странно, потому что должен.
http://www.abbyy.ru/support/finereader/90/product_info/FF
Кроме Home Edition. (Но у Вас же не хоум, потому что хоум и pdf не понимает).
Отв: Что делать с книгами, в которых нет текстового слоя
Вообще-то где-то есть файл, который надо положить в специальную папочку, и тогда ФР9 научается распознавать и djvu. Но я что-то не могу его найти. :(
Попробуйте посмотреть здесь. Там внизу есть ещё пара линков.
Отв: Что делать с книгами, в которых нет текстового слоя
UPD
И правда всемогущество! Написала этот пост я, Tanja45. Но вот сайт уверяет меня, что я вовсе даже и не Tanja45, а совсем даже напротив - JuliaVS. Но я пока ему не верю, я точно знаю, что я не JuliaVS.
Отв: Что делать с книгами, в которых нет текстового слоя
На самом деле это представление справедливо для многих видов деят-ти, обычно связанных с компом.
Я называю это "знание о волшебной кнопке". Или программе.
Которая делает все сама. Моментально, красиво и с учетом любых тараканов-пожеланий в мозгу этого знающего.
Отв: Что делать с книгами, в которых нет текстового слоя
А нам? А книжникам? А мы тоже хотим! Это нечестно!
Отв: Что делать с книгами, в которых нет текстового слоя
O, в каком-то фантастическом сериале видела инопланетный девайс для сканирования книг: проводишь им по корешку и через несколько секунд вся книга отсканирована.
UPD Вот, нашла: http://www.youtube.com/watch?v=9CSPW-VUQis Начиная с 8:25 :)
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
Это обо мне что ли?
я например как увижу где в сети текстик txt, html, doc так сразу этот текстик ручками перенабираю в "блокноте" весь текст целиком. добавляю туда тегов
с редакторами FB2 совершенно не знаком
Отв: Что делать с книгами, в которых нет текстового слоя
Уточнение - с билда 724.
Отв: Что делать с книгами, в которых нет текстового слоя
вообще-то "виртуальный принтер"- это такая программа, которая конвертит любые файлы в PDF. Для конвертации нужно эту программу поставить "принтером по умолчанию" и из любой другой программы(из Ворда,Пэйнта,браузера, Блокнота и т.п.) отправить что-то на печать, как это "что-то" конвертится в PDF.
Вот я и подумал, что может есть такой виртуальный принтер, который картинку в PDF переведет в текст в PDF.
Отв: Что делать с книгами, в которых нет текстового слоя
Я в курсе, что такое виртуальный принтер.
Вы поймите, что есть только один способ перевести картинку в текст: ocr (распознавание). Ну, можно еще набрать текст вручную :))
Отв: Что делать с книгами, в которых нет текстового слоя
Вообще-то "виртуальный принтер" - это программа, которая переводит файл на язык, понятный принтеру. Как реальному, так и виртуальному. Её цель именно в этом - что бы принтер понял, как печатать файл. И для целей принтера совершенно не нужен распознанный файл. Его цель - понять, как печатать то, что есть (подгружать шрифты, или печатать их растром; с каким разрешением печатать; цветное или черно-белое, и т.д.). Выходной файл виртуального принтера - .prn или .ps
То, о чем Вы говорите - "конвертит любые файлы в PDF" - это делает программа Acrobat Distiller. Её цель - преобразовать файл .ps в файл .pdf, что бы можно было увидеть глазами то, что мы увидим на печати.
То, что из прикладных программ это делается в один этап, а не в два, не означает, что процесс один. Это просто видимость, результат работы встроенного дистиллера.
В этом и загвоздка - не нужно принтеру, для того, что бы печатать - распознавать. Да и язык Postscript не позволяет (насколько я знаю).
То, что Вы хотите - это не виртуальный принтер, а виртуальный OCR. Что бы программа типа файнридера сделала всю работу, но Вы бы этого даже не заметили, а потом ещё и результат OCR заново записала в pdf. Чисто технически это наверное возможно реализовать. Только зачем?
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
Это подстановка одних шрифтов вместо других. Процесс более простой, чем OCR.
Функция "печатать шрифт как растр" действительно существует. Но это очень простая операция. А вот "растр как текст" - это уже OCR. Процесс сложный и не нужный для целей принтера.
На самом деле я очарован вашей идеей. Действительно, почему нет автоматического аналога этого процесса.
Ведь что мы делаем в Finereader:
1. Открываем изображения.
2. Анализируем текст (рисуем области).
3. Распознаем текст.
4. Сохраняем во внешнее приложение.
Почему же нельзя это автоматизировать, сделать одним процессом. Где мы просто укажем - входной файл - распознать - выходной файл.
Наверное потому, что это не очень нужно - ведь результат получится грязный. Потому что файнридер позволяет на каждом этапе своих процессов контролировать и поправлять результат.
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
niksi, спасибо за подробное разъяснение.
Отв: Что делать с книгами, в которых нет текстового слоя
в комменте http://lib.rus.ec/node/198011#comment-123124 указал ссылки на 2 книжки Малколма Гладуэлла(на Либрусеке есть на англ., а эти на русском)
"Озарение" и "Переломный момент"
Отв: Что делать с книгами, в которых нет текстового слоя
FR Portable 9 распознает без всяких лишних манипуляций )
Отв: Что делать с книгами, в которых нет текстового слоя
А у меня и не Portable, и тоже распознает без всяких манипуляций. Как установился, так и стал распознавать. Но у меня ХР. А у Вас, Игорёк, Vista?