vitus_wagner | О больших архивах

Crossposts: http://vitus-wagner.livejournal.com/1250611.html

Entry tags:

О больших архивах

Попробовал тут разгрести описанным в предыдущем посте скриптом архив либрусэка завалявшийся с 2009 года.

Получилось - из менее чем 200000 книг 2176 попросту not well-formed XML. В основном от того что народ использует знаки больше-меньше (даже не сдвоенные) в вместо кавычек-елочек, а какие-то распространенные тулзы генерации FB2 это не отслеживают и не заменяют встретившийся в тексте зна < на соответствующий entity. Аналогичные проблемы возникают с амперсэндами.

Ну и плюс к тому куча пробелов, неразрывных пробелов, кавычек, скобочек в полях "имя автора". В принципе можно скрипт пофиксить, чтобы все символы, не участвующие в сортировке по библиографическим правилам, резал.

Но вообще, конечно, все это добро нуждается в вычитки и чистке от артефактов сканирования и распознавания. Поэтому я и держу настолько маленькую библиотеку, что в ней мне все-таки не лень слазить и руками исправить ошибки в XML и метаданных.

А то и пройтись по всему тексту и правильно оформить тэгами разбиение на главы.

Flat | Top-Level Comments Only

а чем не устроил freelib который идет в комплекте к либрусеку для скачивания?
не то чтоб это была совершенная программа, но искать - ищет, критериев поиска довольно много. Индексы свои поддерживает, не тормозит.

Не понял, какую задачу вы предлагаете решать?

Мне не нужна отдельная программа-каталогизатор книг. У меня вообще-то calibre есть, хотя используется исключительнор для снятия DRM с амазоновских книг.

Я хочу добиться того, чтобы для поиска нужной книги можно было эффективно использовать файловую систему.
Потому что к файловой системе есть множество возможных интерфейсов.

Допустим, мне потребовалось найти у себя дома нужную книгу, зайдя туда по ssh через три nat-а и два vpn-а, причем с телефона. Очевидно, что ни freelib, ни calibre этой задачи не решат. А правильно структурированное хранилище в файловой системе - решит.

Далее, читать я все равно буду fbreader-ом, что на десктопе, что на телефоне. Он имеет встроенные средства каталогизации. И для того чтобы они нормально работали, а также для того чтобы книгу правильно воспринял какой-нибудь coolreader у человека, с которым я хочу поделиться, внутри самой книги должна быть правильная метаинформация.

Электронная книга должна быть правильной, независимо от программ, которые с ней работают. А флибусте бы надо на аплоаде валидатор прикрутить и не позволять аплоадить книги, невалидные с точки зрения схемы FictionBook. Ну и некие базовые проверки метаинформации вида "А вот у вас написано автор А.Толстой. У нас уже есть авторы Алексей Константинович Толстой и Алексей Николаевич Толстой, может быть вы имели в виду одного из них?"

Этот пост про то что файлы, лежащие на либрусеке и флибусте в 2% случаев вообще well-formed XML не являются, через xmllint я их еще не все гонял, поэтому процент попадания в схему сказать не могу, хотя может и стоило бы.

При этом в 90% случаев это правится одной-двумя глобальными заменами.

ну если речь по прежнему о файлохранилище либрусека, то он оно решает кучу проблем. Во первых библиотека хранится в архиве, а не набором файлов. сейчас это порядка 100 архивов, более 170 гиг. Если их распаковать получится реальная куча файлов 2 миллиона, может больше, занимающая кучу места на диске. А когда речь идет на такие цифры, то для нормального поиска это все надо индексировать и класть в sql базу.
Файловая система неплоха когда файлов тысячи. А поиск по паре миллионов - увольте.

Речь с самого начала не о файлохранилище либрусека. А о МОЕМ файлохранилище.
В котором какой-то древний архив либрусэка составляет 4 процента.

Если вы не умеете пользоваться файловой системой, то у вас и sql-база будет тормозить секунды на простейших запросах.

Файловая система иерархична. Разбейте ее на 3 уровня, и миллион превратится в сотню.

Что касается sql-Я то я могу точно сказать, что им еще надо уметь пользоваться. Работая в компании, которая занимается как раз базами данных причем и консалтингом тоже, я имею об этом некоторое представление.

Я не понимаю, что вы собираетесь искать по паре миллионов файлов? Цитату? По всей базе без разбора?
Но тут вас никакие архивы не спасут.

Если же нужно найти книгу, по автору и заглавию или по любой другой метаинформации вынесенной в структуру файловой системы, то никакого "поиска по 2 миллионам" тут нет. Вы идете и берете
Шаг первый - имя автора начинается с этой буквы. Вариантов примерно полсотни.
Шаг второй - имя автора такое-то. Внутри буквы здесь может быть до нескольких тысяч вариантов, но современные файловые системы с таким вполне справляются. Хотя вот тут человек описывал создание префиксов из 4-х букв и группировку их в более-менее равные по численности группы. Правда, в такой схеме completion работать не будет, и этот шаг придется делать какими-то нестандартными средствами.
Шаг третий - у этого автора книга называется так-то. Даже Жюль Верн за свою долгую и плодотворную жизнь написал меньше двух сотен томов.

Это получится намного быстрее, чем запустить специальную программу оболоочку, найти базу данных и выполнить запрос.

Я на самом деле пользовался поначалу базой данных от mylibru, ее, правда, проектировал какой-то школьник, не имеющий никакого представления о реляционной теории. Но при МИЗЕРНЫХ объемах, которые имеют каталоги библиотек, это не страшно.

После нахождения нужной книги ее надо извлечь из соответствующего архива. А zip-архивы, конечно, лучше tar.gz оптимизированы на скорость произвольного доступа, но сильно уступают в этом файловым системам.

Потом извлеченную книгу скопировать на устройство.

Вообще представления о том, что миллилоны это много, это миф, сохранившийся со времен MS-DOS c 640Кb enough for everyone. Современные компьютеры имеют гигабайты памяти, то есть туда впишутся если тупо грузить в более-менее оптимизированные структуры данных, десятки миллионов каталожных карточек.

бедненький сценарий поиска вы предложили. В реальности будет так: "помнится была книжка из серии фантастика или научная фантастика. Автора не помню. Вроде в названии было что-то про звезды. Как бы мне ее найти?" Все, у тебя после этого перебор 2-х миллионов файлов навсегда. И никакая иерархия твою файловую систему не спасет. И никакие гигабайты памяти. Собственно к памяти этот процесс поиска вообще не имеет отношения. Так как тормозить будет процесс перебора файлов, открытия их и чтения тегов из каждого.
Альтернатива одна - Строим индексы, кладем их в базу разница в скорости поиска будет не в разы, в десятки, если не сотни раз.
А как оно там хранится в самих архивах в принципе вообще все равно. По хорошему можно вообще все тексты в базу загнать чтобы дать пользователю и по тексту искать, но это уже напряг для базы - полнотекстовый поиск. Хотя все равно будет быстрее чем открывать пофайлово

>напряг для базы - полнотекстовый поиск

Для специализированной базы - не напряг. Их уже уйму понаписали. Да и в постгресе полнотекстовый поиск хорошо работает, насколько я помню к движку БД что-то специализированно-поисковое прикрутили разработчики Авито.

Так поиск по метаинформации из FB2 чем занимаются все эти католлогизаторы, проблемы не решит.

А решит проблему, например, полнотекстовый индекс. Посторить который над кучкой аккуратно разложенных файлов я запросто могу с помощью любого инструмента полнотекстового поиска - хоть omega, хоть lucene. Нужно только правильный конвертер присобачить, чтобы он некоторым полям из метаинформации больший вес ставил, чем просто тексту.

Вопрос в том что большая монолитная программа-каталогизатор практически недоступна для расширения. Даже если у нее есть развитая система плагинов, освоение ее потребует слишком много времени.

А когда у меня система хранения расчитана на максимальное использование стандартных средств работы с файловой системой, которые не надо осваивать не только мне, но и авторам тех специализированных инструментов, которые могут мне понадобиться (систем полнотекстового поиска, например), гораздо проще собрать из кубиков все, что требуется.

нет, естественно оправдание собственному желанию продолжать трахаться и трахаться с открытым кодом доводя тупиковую идею до совершенства, а потом прикручивая к нему базу, так как все равно без нее работать не будет ... Не нужны никому стандартные средства работы, универсальные api и прочие базвордс. Пользователю нужна база от либрусека на 170+ Gb, готовый каталогизатор, и возможность скачать через год не новые 170 и все что набежало за год, а только добавку и индекс. И плевать пользователю что там ssl не свежая. И то что программа не обновляется часто - так же плевать ибо работает. Ну а тому кому шашечки, а не ехать - те велком в мир тех самых открытых стандартов итд по списку

>напряг для базы - полнотекстовый поиск.

Если это один человек со средним современным десктопом наперевес и пол-тэрабайта текстов -- то не сказать чтобы и напряг.

>нескольких тысяч вариантов, но современные файловые системы с таким вполне справляются.

Они и с миллионами файлов в директории справляются. Только гуёвые файловые менеджеры плохо работают и ls тормозит. Конечно, это всё не про fat.

Посмотрел на исходники этой freelib. Написано очень неряшливо, документировано безобразно, использует Qt и не просто Qt, а Qt 5.5.

У меня в дистрибутиве, между прочим, qt 5.3.2 и это ни разу не oldstable.

Кроме того там в дистрибутиве исходников лежат бинарные файлы - kindleindex для всех платформ и openssl-евские .dll для Windows. Причем последние - 2009 года выпуска. И ничего не сказано про то, где взять обновленные версии.

Хотя дыры в OpenSSL находят регулярно. И между прочим я уже сталкивался со случаем, когда OpenSSL 2007 года оказалась в принципе несовместимой с современным https-сайтом.

Потому что алгоритмы тоже устаревают и выводятся из эксплуатации.

В общем крайне не рекомендую freeLib. Если уж жить нельзя без каталогизатора, используйте calibre.

Edited 2017-01-22 19:04 (UTC)

здесь принцип "самое последнее значит самое хорошее" не вполне работает. здесь надо придерживаться другого принципа: "работает, не трогай". Ну а для перфекционистов у которых есть лишнее время, никто не запрещает переписать. Кстати, либрусек отдает и какой то второй каталогизатор MyHomeLib кажется.
А Калибри как каталогизатор я не рассматривал, но это худший файл-конвертер который я когда либо видел.

Вот как раз принцип "самое последнее значит самое хорошее" и нарушает автор freelib, используя последнюю версию Qt.

А вот в случае openssl "работает не трогай" означает, что она работает НЕ В ТВОИХ ИНТЕРЕСАХ. Это библиотека, критичная для безопасности компьютера, и любая ошибка в ней - remote exploit практически автоматом.

lib.rus.ec вообще не отдает книг. Уже давно. Поэтому он меня и не интересует.

calibre, действительно является ужасным конвертером файлов. Потому что у конвертера файлов не должно быть GUI. И не должно быть своих представлений о том, где правильно хранить эти самые файлы. Вот указал пользователь входной файл, указал выходной - оно сконвертировало. Ну и естественно, автоматическая конвертация имеет существенные ограничения. Но когда надо конвертировать из проприетарных форматов в открытые, все равно конвертировать приходится.

оно не требует инсталляции. Работает из фолдера куда положили. Какая дыра в безопасности может быть, для софта который пускается раз в неделю на пять минут чтобы забрать из библиотеки книжку и закинуть ее в фолдер на диск. При этом системные библиотеки как были нормальной версии, так и есть. А приложение подгрузило дырявую библиотеку, воспользовалось ей (не факт что пользуется вообще пока ты используешь локальную базу) и выгрузило. Доступа извне к этой программе никто не имеет. Доступа ее фолдеру с дырявой библиотекой тем более.

Если ты скачал себе бинарник с левого сайта и запустил его - у тебя уже троян.

Впрочем, с какого перепуга оно запустится на любой современной машине, оно ж 32-битное. А откуда у меня 32-битная libqt5, тем более версии более новой чем та, что у меня пришла с дистрибутивом?

Этот софт ходит на внешний сайт по HTTP. Следовательно уже уязвим к атакам. Более того, любой потенциально атакующий знает, на какой именно сайт ходят миллионы пользователей этого софта. А серверный софт написан на php. Тоже дыра-дырой. Ломаем сервер, ставим там эксплойт для древней openssl и voila - ботнет из миллиона узлов у нас в руках.

Уверяю тебя, что троянов в интернете разбросано не так много как бинарников. Опять же, что мешает любознательному пользователю просто пойти на virustotal и разом проверить бинарник сразу 40 антивирусами? Для файлов с датой более месяца оно там вероятнее уже просто есть.
И трудно сказать как оно (32 bit) работает, но win 7 64bit его пускает прекрасно. Как видимо проблема с вашей стороны. А то, что софт ходит на внешний http - так это не бага а фича, так сказать дополнительная функциональность которой просто не стоит пользоваться. Да и собственно зачем, если локально уже все скачено, и все проиндексировано.

>Для файлов с датой более месяца оно там вероятнее уже просто есть.

Virustotal - вообще не аргумент. Вот, например, старые версии acrobat reader - дырявы по самое немогу: https://cve.mitre.org/cgi-bin/cvekey.cgi?keyword=adobe+acrobat. Все об этом прекрасно знают. А теперь покажи мне антивирус, который предупредит пользователя об опасности.
Кроме того, создатель malware всегда может модифицировать его до тех пор, пока оно не перестанет детектироваться антивирусами. Да, завтра антивирусы научатся детектировать и новую версию, но ущерб уже будет нанесён.

> Уверяю тебя, что троянов в интернете разбросано не так много как
> бинарников.
Но при установке на компьютер N бинарников вероятность остаться чистым падает экспоненциально. Как в русской рулетке.

Случай openssl особенно хорош ещё тем, что при некоторых условиях не надо будет ломать тот сайт. Достаточно получить контроль над каким-нибудь промежуточным роутером, иногда дажэ его не взламывая, чтобы воткнуться в дырявую реализацыю TLS.

>Какая дыра в безопасности может быть

Большая.

Насколько я понимаю, конкретно эта версия не подвержэна уязвимости heartbleed, но как пример того, чем можэт закончиться использование openssl с известными багами эта уязвимость хорошо подходит.

Имхо, если из огромной файлопомойки, скачанной 8 лет назад, всего 1/1000 файлов оказалась корявого формата - это очень повезло

Не 1/1000, а целых полтора процента. Это я еще не посчитал другие типичные ошибки, вроде разнобоя в спеллинге имен авторов и названий серий (которые реально достатют при работе с этими файлами в андроидном fbreader), некорректно размеченные секции (что мешает навигации по оглавлениям), нераспознанные слова (кстати второй по частоте источник non-well-formedness после замены кавычек-елочек на знаки больше-меньше), всякую фигню в виде попавших при сканировании в текст в виде абзацев номеров страниц.

А, пардон, обсчитался. 2К из 200К. Но всё, равно, имхо, для файлопомоек это очень хороший показатель.

Flat | Top-Level Comments Only

О больших архивах

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject

no subject