В ЮУрГУ создали интеллектуальную систему проверки документов по реестрам Минюста и Росфинмониторинга

Разработка объединяет данные по иностранным агентам, нежелательным и экстремистским организациям, а также материалам и лицам, причастным к терроризму, в едином автоматизированном сервисе.

В Южно-Уральском государственном университете разработан прототип веб-системы для автоматического анализа документов на предмет упоминаний лиц, организаций и материалов из официальных реестров Министерства юстиции РФ и перечня Росфинмониторинга. Инициаторами создания сервиса выступили Служба безопасности и Библиотека ЮУрГУ. В настоящее время прототип «Системы проверки документов по реестрам Минюста РФ» проходит тестирование в Библиотеке ЮУрГУ.

По итогам пилота и доработок софт выйдет в промышленную эксплуатацию.

Разрабатываемый сервис, получивший название «Система проверки документов по реестрам Минюста РФ», рассматривается как инструмент предварительной аналитики. Он автоматически извлекает из загруженных PDF- или TXT-документов имена, названия организаций и наименования материалов, сопоставляет их с актуальными базами данных и формирует детальный отчёт. При этом разработчики подчёркивают: система не выносит правовых решений и не присваивает статусы. Её задача – помочь специалисту обнаружить в тексте фрагменты, требующие дополнительной проверки по официальным источникам.

«Это не система "вычисления" или автоматического осуждения, – поясняет доцент центра образовательных программ топ-уровня в сфере ИИ «ВиртУм» ЮУрГУ Владимир Сурин. – Сервис показывает совпадения и контекст, а окончательное решение всегда остаётся за человеком».

Изначально разработка ориентирована на сотрудников библиотек, работающих с большими массивами документации. Однако в перспективе функционал может быть востребован в редакциях СМИ, пресс-службах, юридических отделах и службах безопасности организаций, которые готовят, размещают или проверяют публичные материалы. Система объединяет данные из пяти ключевых категорий официальных источников: иностранные агенты (организации и физические лица из реестра Минюста России), нежелательные организации (иностранные и международные НКО, деятельность которых признана нежелательной в РФ), экстремистские организации (общественные и религиозные объединения, признанные экстремистскими), экстремистские материалы (книги, фильмы, музыкальные альбомы и иные произведения из федерального списка Минюста), а также лица и организации, причастные к терроризму (записи из официального перечня Росфинмониторинга). База данных сервиса формируется автоматически: данные собираются через API и с официальных страниц Минюста, а также из перечня Росфинмониторинга. Актуализация информации происходит ежедневно в 3:00 по местному времени, при необходимости обновление можно запустить вручную через API. Старые записи каждой категории заменяются новыми, что исключает накопление дублей внутри одного реестра.

С технической стороны прототип системы представляет собой веб-решение на базе FastAPI с хранением данных в PostgreSQL. – Фоновые задачи обрабатываются с помощью Celery и Redis. Решение кроссплатформенно и может работать в средах Windows, Linux и macOS.

«Проект учитывает все тонкости морфологии русского языка: система генерирует падежные формы фамилий, варианты с инициалами и написания «фамилия, имя» (например, «Иванов», «Иванова», «Иванову»), что позволяет не пропускать упоминания в любом контексте, – говорит разработчик. – Скоростной поиск реализован с применением алгоритма Ахо-Корасика, после обновления баз данных этот индекс перестраивается автоматически. Контекстная верификация с помощью локальной языковой модели отсеивает ложные срабатывания, оставляя только подтвержденные совпадения для итогового отчета».

Отличие разработки ЮУрГУ от существующих аналогов (как правило, платных или с ограниченным функционалом) заключается в объединении нескольких реестров в одном сервисе, автоматическом обновлении данных и выдаче понятного отчета по конкретному документу с указанием найденного имени, категории, фрагмента текста, номера страницы и ссылки на официальный источник.

В тестовой версии пользователь может загрузить документ объёмом до 50 МБ. Далее происходит извлечение текста, его сопоставление с записями реестров и дополнительная проверка найденных совпадений с помощью языковой модели. В финальном отчёте прототипа системы указываются найденное имя, название организации или материала; категория реестра; фрагмент документа с совпадением; номер страницы; прямая ссылка на официальный источник; уровень уверенности совпадения. Если одна организация присутствует в нескольких реестрах, система фиксирует все статусы и сообщает о каждом из них.

В настоящее время система проходит апробацию в Библиотеке ЮУрГУ. Тестирование проводилось на документах различного объёма: от текстовых файлов размером около 7 КБ до PDF-документов на 500 страниц. Время обработки варьируется от 10 секунд до 10 минут в зависимости от размера файла. Так, при прогоне большого нормативного текста, содержащего выдержки из реестров, этап детерминированного поиска выдаёт несколько десятков кандидатов (например, 21 совпадение). Последующая контекстная верификация языковой моделью позволяет отсеять ложные срабатывания и предоставить пользователю только подтверждённые результаты.

Разработчики отмечают, что актуальность системы продиктована большими объёмами документов и регулярным обновлением реестров. Ручная проверка не только отнимает время, но и повышает риск пропустить упоминание, особенно если имя или название приведены в тексте в иной грамматической форме. Production-версия программы должна помочь решить эту проблему после завершения тестирования, став надёжным помощником для специалистов, работающих с публичной документацией.

Больше новостей на канале ЮУрГУ в МАКС

Вы нашли ошибку в тексте:
Просто нажмите кнопку «Сообщить об ошибке» — этого достаточно. Также вы можете добавить комментарий.