
Методы и алгоритмы интеграции большого объема библиографических записей в открытое семантическое пространство
О.Н. Шорин
Аннотация: Осуществлена разработка методов, алгоритмов и программной инфраструктуры для организации глобально распределенной обработки данных, получаемых из библиографических записей, с последующей их публикацией в LinkedOpenData. Проведено исследование предпосылок возникновения семантической паутины, а также проанализированы существующие решения по семантической интеграции библиографических записей. Дано описание масштабируемого алгоритма установления близости текстовых полей, основанного на методе разбиения значений на биграммы с последующим отсечением с использованием меры Жаккара. Для разработанного алгоритма доказаны две теоремы, позволяющие оптимизировать подсчет меры Жаккара. Разработана онтология предметной области, состоящая из минимального количества классов и свойств. Представлены XSLT-шаблоны для преобразования данных с учетом разработанной онтологии.Разработан алгоритм обнаружения дублетных библиографических записей и аддитивного пополнения данных в LOD в автоматическом режиме с использованием разработанной онтологии предметной области. Описаны методы и алгоритмы, применяемые для хранения связанных данных и создания ссылок на внешние источники. На примере массива библиографических записей электронного каталога Национальной электронной библиотеки приведены результаты функционирования созданной системы интеграции. Представлена различного рода статистика, доказывающая достоверность полученных теоретических результатов.
Библиографическое описание: Шорин, О.Н. Методы и алгоритмы интеграции большого объема библиографических записей в открытое семантическое пространство / О.Н. Шорин // Диссертация на соискание ученой степени кандидата технических наук. – Федеральный исследовательский центр «Информатика и управление» РАН. – Москва. – 2017.
На этой странице приведено только введение моей диссертации
Полный текст диссертации доступен в PDF-версии для скачивания и на странице диссертационного совета
Введение
Актуальность проблемы. Задача книгоописания возникла за несколько тысячелетий до нашей эры. В ту эпоху человечество начало создавать книжные собрания, которые требовали ведения некоего подобия каталога. Одним из старейших списков книг, который может быть признан каталогом, является шумерская глиняная плитка, датированная 2000 г. до н.э.. Она была найдена в Ниппуре и хранится сейчас в музее Пенсильванского университета [108]. Скорее всего, крупные книжные собрания появились в Древнем Египте гораздо раньше, но, к сожалению, папирус, используемый египтянами, не настолько долговечный материал, как глиняные таблички.
Мощный скачок в развитии каталогизация получила в середине VI века, когда в Европе стали появляться монастыри. Книги, хранившиеся в библиотеках монастырей, подлежали строжайшему учету, поскольку представляли собой значительную материальную ценность из-за дороговизны пергамента и огромной трудоемкости по переписке. С ростом фонда библиотек разрастался и каталог, что неизбежно привело к созданию элементарных правил, направленных на поддержание порядка в записях.
Постепенно в библиотеки начали поступать книги светского содержания, что повлекло за собой создание аппарата для описания книг, направленного на разыскание рукописей читателями. Описания в каталоге стали группироваться по различным признакам: именам авторов, форме произведений, предметам и характеристикам. В качестве примера такого каталога можно привести каталог Гладстонберийского аббатства [153].
Огромное значение на развитие книгописания оказала попытка создания сводного каталога 183 монастырских библиотек Англии в 1250-1296 гг. Для обозначения библиотеки-участницы в каталоге использовалось краткое условное обозначение в виде номеров – сигл.
В XV в. значительно расширился круг авторов за счет произведений деятелей эпохи Возрождения. Изменился и состав читателей: помимо монахов библиотекой стали пользоваться люди разносторонних интересов. Их запросы потребовали изменения правил каталогизации, что привело к появлению алфавитного авторского указателя к систематическому каталогу [131].
В середине 1440-х годов Иоганн Гуттенберг изобрел печатный станок [36], это привело к бурному развитию книготорговли. Каталоги стали выполнять функцию плакатов, рекламирующих издания на книготорговых ярмарках. В качестве примера можно привести афишу Петра Шеффера, которая была напечатана в 1469-1470 гг. и содержала 21 книгу.
Распространение книгопечатания поставило новые задачи перед каталогизацией: необходимо было охарактеризовать не отдельный экземпляр, а издание целиком. Для этого в описания книг были добавлены новые элементы – имена издателей, место и год издания.
Развитие науки и книгопечатания привели к бурному росту количества книг в библиотеках. В XVII в. стало очевидно, что библиотека представляет собой не просто набор книг. Она в обязательном порядке должна содержать четко организованную систему каталогов, позволяющую ориентироваться в фондах. Одним из первых такую мысль высказал Габриэль Ноде [115], который настаивал на необходимости создания алфавитного каталога, в то время как до этого времени считалось, что достаточно иметь только систематический каталог. Тогда же библиотеки начали издавать первые печатные библиотечные каталоги. В качестве такого примера можно привести каталог книг Бодлеянской библиотеки [44]. К XVIII в. библиотекари пришли к выводу, что печатать каталоги в виде книг неудобно, поскольку постоянный приток новых поступлений невозможно было оперативно отобразить в печатном каталоге. Появление карточного каталога позволило решить эту проблему – своевременно отображать в каталоге информацию о новых книгах.
Требования к библиотекам и их каталогам со стороны научного сообщества неуклонно возрастали, т.к. появлялись издания на иностранных языках, переводные издания, специфические фонды, например, географические карты, периодика, изобразительный материал. Каталоги библиотек не могли удовлетворить требованиям читателей, что привлекло к проблемам каталогизации виднейших ученых XIX в. Именно в это время были заложены фундаментальные основы науки каталогизации в целом и формирования библиографической записи в частности.
Среди основных работ того времени хочется выделить исследования первого директора петербургской Публичной библиотеки А.Н. Оленина [37], Guillaume-François Debure [83], Antonio G. M. Panizzi [117], Thomas H. Horne [110], В.И. Собольщикова [45], Charles C. Jewett [103], Charles A. Cutter [80], Karl Dziatzko [85].
В первой половине XX в. развитие каталогизации было направлено в сторону создания национальных сводов правил книгоописания. А к середине прошлого столетия стало очевидно, что правила каталогизации в разных странах обязаны идти по пути неуклонного сближения [12]. На первый план вышли проблемы, связанные с использованием различных языков: транскрипция и транслитерация фамилий и имен, перевод заголовков и названий, описание переводных работ и международных договоров.
Во второй половине XX в. появились вычислительные машины, которые стали применяться в различных областях, в том числе и в каталогизации. Назрела необходимость создания машиночитаемого формата, который содержал бы перечень полей и правила их наполнения. Формальная логика вычислительных устройств требовала явного наличия или отсутствия элементов описания, в то время как человек мог интуитивно отделить автора от названия, глядя на каталогизационную карточку.
Разработкой и модернизацией форматов машиночитаемых библиографических записей в России занимались В.В. Скворцов [42], Е.И. Загорская [17, 24, 25], Н.П. Никольцева [17], Н.Н. Каспарова [5, 23–25], М.В. Экстрем, Т.А. Паршина, Г.Р. Ридер [59], Е.Д. Жабко [13], Т.Л. Масхулия [16, 35, 41], Ю.Г. Селиванова [16, 41], Л.В. Завьялова [16], М.В. Стегаева [16, 41], И.С. Дудник [5, 8], Т.А. Бахтурина [3–5], Г.П. Калинина [21, 22] и др.
Принципами создания автоматизированных библиотечных систем и электронных библиотек, опирающихся на использование машиночитаемых форматов библиографических записей, занимались Я.Л. Шрайберг [10, 11, 18, 57, 58], Ф.С. Воройский [9–11, 58], А.И. Земсков [18], Б.И. Маршак [33, 34], К.А. Колосов [28, 29], А.И. Племнек [38, 39], Б.Р. Логинов [32], Н.Е. Каленов, Г.И. Савин, А.Н. Сотников [20], В.М. Богданова, М.М. Горбунов-Посадов, Т.А. Полилова, М.И. Cлепенков [7] и др.
В 2006 г. Tim Berners-Lee сформулировал основные принципы связанных данных [67], из которых на основе интернета можно построить семантическую паутину. Отличие семантической паутины заключается именно в термине «данные», которое ставилось в противовес существовавшему на тот момент, пусть и «гипер-», но всё же «тексту». С точки зрения связанных данных библиографические записи представляют огромный интерес, поскольку объекты, информация о которых хранится в записях, взаимосвязаны: авторы связаны со своими произведениями, сериальные издания связаны друг с другом через общую часть, издательства имеют непосредственное отношение к изданным у них книгам и т.д.
Представлением библиографических записей в виде связанных данных занимаются ведущие каталогизаторы и специалисты информационных технологий В.В. Скворцов [43], О.Н. Жлобинская [14], А.А. Бездушный, А.Н. Бездушный, В.А. Серебряков, В.И. Филиппов [6], Bermès Е. [66], Svensson L.G. [124, 126], Böhme C. [72], Tillet B. [129, 130] и др.
С использованием принципов, предложенных Berners-Lee, в интернете реализуется проект открытых связанных данных – Linked Open Data [71], целью которого является интеграция данных из различных областей знаний, в том числе и библиографической информации. Поставщиками данных из библиографических записей в LOD являются как отдельные библиотеки, так и различные консорциумы. В качестве примеров можно привести работы, ведущиеся в Библиотеке Конгресса, Национальной библиотеке Франции [123], Национальной библиотеке Германии [125], Британской библиотеке [136], проекте Виртуальный Международный Авторитетный файл – Virtual International Authority File [95, 137], электронной библиотеке «Научное наследие России» [19].
Наличие открытого доступа к массиву библиографической информации с возможностью обнаружения семантически связанных данных является одной из составляющей развития как культуры в целом, так и отдельных направлений в книжной отрасли в частности. Преимущества от публикации библиографических записей в Linked Open Data трудно переоценить. На 78-ом Всемирном библиотечном конгрессе Международной федерации библиотечных ассоциаций IFLA, который состоялся в 2012 году в Хельсинки, были озвучены следующие преимущества от публикации данных в связанном виде [60]:
- Открытый доступ и обмен метаданными.
- Способствование случайному обнаружению новых источников данных.
- Выявление основных шаблонов использования ресурсов и метаданных.
- Навигация, основанная на использовании фасетов.
- Обогащение метаданных с использованием ссылок.
Однако, при публикации данных, собранных из различных источников, неизбежно возникают вопросы интеграции данных: выявление дублетных записей и их слияние. Решением подобного рода проблем занимались Ivan P. Feleggi и Alan B. Sunter [86], Jeremy A. Hylton [88], Mauricio A. Hernández и Salvatore J. Stolfo [94], William E. Winkler [133], Pawel Jurczyk [105], В.А. Серебряков, А.Б. Антопольский, А.А. Каленкова, А.Н. Сотников [1], Д.Н. Рубцов и В.Б. Барахнин [40], О.М. Атаева и Л.Н. Шиолашвили [2], А.А. Князева, И.Ю. Турчановский, О.С. Колобов [27] и др.
В мире существует всего несколько проектов по решению комплексной проблемы интеграции данных из различных библиотек, представленных в разных форматах, с выявлением дублетных записей с последующим их слиянием, преобразованием в связанные данные и публикацией в LOD. Крупнейшим из них является проект по интеграции данных из европейских библиотек, музеев и архивов – Europeana [155]. Подход, применяемый в проекте Europeana, не может быть применен к решению нашей задачи, поскольку он основан [101] на использовании единого формата представления данных и неавтоматизированном механизме связывания данных.
Цель диссертационной работы. Расширение возможностей интеграции библиографических записей в открытое семантическое пространство.
Решаемая научная задача. Разработка методов и алгоритмов интеграции больших объемов библиографических записей в открытое семантическое пространство.
Подзадачи. Реализация поставленной цели предполагает решение следующих подзадач:
- Анализ существующих решений в области интеграции библиографических записей в открытое семантическое пространство.
- Разработка совместимой с уже существующими онтологии предметной области с учетом полноты представленной в библиографических записях информации.
- Разработка алгоритмов, обеспечивающих установление близости текстовых полей библиографических записей.
- Разработка системы интеграции библиографических записей, позволяющей формировать, хранить и предоставлять доступ к данным с использованием принципов Linked Open Data.
На защиту выносятся:
- Структура и формат онтологии для публикации данных, полученных из библиографических записей, в открытом семантическом пространстве.
- Масштабируемый алгоритм установления близости текстовых полей в библиографических записях, основанный на методе разбиения текстовых значений на биграммы с последующим отсечением с использованием меры Жаккара.
- Алгоритм обнаружения дублетных библиографических записей и аддитивного пополнения данных в LOD в автоматическом режиме с использованием разработанной онтологии предметной области.
- Архитектура сбора, хранения и публикации библиографических данных, позволяющая в автоматическом режиме осуществлять сбор библиографических записей из различных библиотек России, конвертировать их в формат, пригодный для публикации в LOD, проводить аддитивное пополнение данных и устанавливать связи с уже опубликованными в LOD данными.
Научная новизна. Новизна первого результата состоит в том, что в отличии от существующих решений предложена онтология, состоящая из минимального количества классов и свойств, что позволяет использовать её в качестве базиса для построения более сложных словарей, сохраняя при этом совместимость с уже существующими решениями. Отличительной особенностью второго научного результата выступает набор оптимизаций, основанных на методе построения множеств биграмм из текстовых строк с последующим использованием полученных биграмм для подсчета меры Жаккара. Третий научный результат характеризуется тем, что предложена совокупность правил адаптации алгоритма в зависимости от количества и качества библиографических записей, что делает алгоритм масштабируемым. Оригинальность четвертого научного результата состоит в гибридном подходе использования централизованной и распределенной архитектуры, позволяющем масштабировать полученную систему на сколь угодно большой объем данных без потери качества получаемых результатов.
Методы исследований. В работе применялись методы сравнительного анализа, моделирования, классификации, непараметрической статистики, сопоставления строк, связывания записей, а также методы анализа и синтеза информационных систем.
Теоретическая значимость исследования состоит в развитии концепции представления библиографических записей из разнородных источников в виде связанных данных, а также в определении технологических принципов дальнейшего расширения списка поставщиков метаданных. Также в результате исследования были разработаны алгоритмы выявления дублетных библиографических записей, создания обогащенной записи и связывания данных с уже опубликованными данными в LOD.
Практическая значимость и реализация результатов исследования заключаются в создании модульного программного комплекса, позволяющего консолидировать библиографические записи из различных библиотек, выявить дубликаты и произвести их слияние, сконвертировать метаданные, используя разработанную схему представления, и опубликовать их в связанном виде в LOD. Благодаря созданному программному комплексу международное библиотечное сообщество получило информацию о российских публикациях, которая обновляется в автоматическом режиме.
Цели и задачи исследования определили логику изложения материала и структуру диссертационной работы. Она состоит из введения, четырех глав и заключения. Каждая глава завершается выводами. Список литературы содержит 156 наименований. В диссертации 7 рисунков, 12 таблиц, 1 график, приводится 5 приложений.
Апробация работы. Основные положения диссертации изложены в 10 публикациях [47-56], две из которых [48, 52] опубликованы в изданиях, входящих в перечень ВАК РФ российских рецензируемых научных журналов, в которых должны быть опубликованы основные научные результаты на соискание ученых степеней доктора и кандидата наук по специальности 05.13.11. По теме диссертации были сделаны сообщения и доклады на международных научно-практических конференциях, симпозиумах и форумах: 79th IFLA General Conference and Assembly «IFLA World Library and Information Congress» (Сингапур, 2013г.), Двадцать первая Международная конференция «Крым-2014» «Библиотеки и информационные ресурсы в современном мире науки, культуры, образования и бизнеса» (г.Судак, Крым, 2014 г.), XIII Международная научно-практическая конференция «Электронный век культуры» (г.Сочи, Краснодарский край, Россия, 2014г.), Четвертый Всероссийский симпозиум «Инфраструктура научных информационных данных и систем» (г.Санкт-Петербург, Россия, 2014г.), 13-я Научно-практическая конференция «Участники и пользователи Национального информационно-библиотечного центра ЛИБНЕТ» «ЛИБНЕТ-2014» (г.Звенигород, Россия, 2014г.), EMC Forum 2014 (г.Москва, Россия, 2014г.), 18-е заседание Совета сотрудничества национальных библиотек России (г.Санкт-Петербург, Россия, 2014г.), V Всероссийская научно-практическая конференция «Фонды библиотек в цифровую эпоху: традиционные и электронные ресурсы, комплектование, использование» (г.Санкт-Петербург, Россия, 2015г.), Международный профессиональный форум: «Книга. Культура. Образование. Инновации.» (г.Судак, Крым, 2015г.), XVII Всероссийская научная конференция «Научный сервис в сети Интернет» (пос.Дюрсо, Краснодарский край, Россия, 2015г.), Пятый Всероссийский симпозиум «Инфраструктура научных информационных данных и систем» (г.Санкт-Петербург, Россия, 2015г.), Второй Международный профессиональный форум: «Книга. Культура. Образование. Инновации.» (г.Судак, Крым, 2016г.).
Реализация и внедрение результатов работы. Разработанная в диссертации система семантического связывания библиографических связей внедрена и используется в ФГБУ «Российская государственная библиотека» - операторе Национальной электронной библиотеки (НЭБ), что подтверждено справкой о внедрении №77/11-1567 от 18.10.2016г. В процессе разработки алгоритм выявления дублетных библиографических записей с последующим их слиянием был также апробирован на массиве записей ФГБУ «Российская национальная библиотека».



