Классические методы анализа данных часто оказываются неэффективными при работе с неструктурированными массивами — научными статьями, патентами, постами в соцсетях. Текст научной публикации — это не просто набор слов, а сложная система связей между авторами, организациями, тематиками и цитатами. Извлекать из таких данных новые знания, а не просто статистику, невозможно без иного методологического подхода. В НИЯУ МИФИ разработали комплексную систему интеллектуального анализа разнородных данных, которая превращает хаос в структурированную базу знаний. Работа выполнена под руководством доктора технических наук, заведующего кафедрой анализа конкурентных систем Алексея Артамонова и стала основой его докторской диссертации. Система уже апробирована на атомной энергетике, медицине и финансовой безопасности, а в перспективе разработчики планируют интеграцию с нейросетевыми моделями для тонкого семантического анализа.
Научные публикации, патенты, цифровые профили пользователей — эти массивы данных растут экспоненциально, но традиционные инструменты анализа с ними справляются плохо. Текст статьи — это не просто последовательность слов. Это сеть взаимосвязей: авторы, организации, тематики, результаты экспериментов, цитируемые работы. Чтобы извлекать из такого массива не просто статистику, а новые предметные знания, нужен другой подход. Его предложили в МИФИ.
Разработанная система использует «универсальный цифровой конструктор» — набор инструментов и моделей для каждого типа данных. Её основа — единая модель цифрового объекта. Любой информационный объект описывается одинаково: статические свойства (дата, автор), динамические (частота публикаций) и вычисляемые (индекс цитируемости), а также граф связей с другими объектами. Это обеспечивает единое представление данных из разных источников и служит основой для гибких алгоритмов обработки.
Второй ключевой компонент — методы преобразования исходной информации. Они автоматически извлекают из текстов структурированные данные: физические величины с приведением к системе СИ, координаты организаций, ключевые термины, содержимое таблиц и подписей к рисункам, данные о международном сотрудничестве. Исходный массив документов превращается в обогащённую базу знаний.
Для визуализации разработаны инструменты построения гетерогенных графов — они наглядно отображают связи между публикациями, авторами и тематиками, выявляя скрытые закономерности. Также создана методика построения научно-технологических ландшафтов — трёхмерных интерактивных карт, по осям которых откладываются научные направления, временные интервалы и объёмы публикационной активности. Эти инструменты, по словам разработчиков, востребованы при принятии управленческих решений на государственном уровне, в том числе в рамках национальных проектов технологического лидерства.
Как пояснил Алексей Артамонов, «если мы хотим извлекать из таких массивов не просто статистику, а новые предметные знания, необходим иной методологический уровень». В ближайшей перспективе учёные планируют интеграцию с нейросетевыми моделями. На текущем этапе применяются классические методы машинного обучения. Следующим шагом станет переход к тонкому семантическому анализу. «Мы хотим, чтобы система не просто находила числовые значения в тексте, а понимала контекст: различала, когда автор сообщает о результатах собственного эксперимента, а когда цитирует чужую работу; улавливала нюансы тональности в социальных данных; выявляла скрытые взаимосвязи между событиями, которые не лежат на поверхности», — отметил Артамонов.
Разработка ведётся в рамках научной школы, возникшей на кафедре анализа конкурентных систем института международных отношений НИЯУ МИФИ. С 2008 года здесь ведутся работы по мультиагентным системам обработки научно-технической информации, создаются новые методы, алгоритмы и программные средства для потоковой обработки, анализа и визуализации данных.






















