Программные инструменты поиска близких фрагментов в коллекции учебных документов
Аннотация:
В статье рассматриваются методы автоматического разделения электронных документов в формате docx и pdf на логические фрагменты (разделы и главы) с последующим семантическим анализом с помощью модели Sentence-BERT. Первый метод выявляет и анализирует изменения шрифта и стилей текста, таким образом обнаруживая начало главы или раздела. Второй – конвертирует документ pdf в docx, находит главы со служебными словами по типу «Глава», «Содержание» и др., найденные главы выводит в графический интерфейс с последующей ручной настройкой, что эффективно для файлов, которые имеют нестандартную разметку. Третий метод использует встроенные закладки в документе, что обеспечивает максимальную точность для документов с предопределенной структурой. Для семантического анализа фрагментов используется модель Sentence-BERT, которая выявляет смысловые связи между главами и разделами. Приведены результаты тестирования на 74 документах, которые показывают преимущества и недостатки каждого метода. Разработанные инструменты автоматизируют процесс обработки документов, позволяя быстро делить коллекцию документов на смысловые фрагменты для поиска схожих фрагментов в ней, а также провести анализ найденных близких по содержанию пар с помощью графического интерфейса.
Ключевые слова:
обработка документов, семантический анализ, разделение на главы, PDF, Sentence-BERT