Quinex: новый инструмент для извлечения числовых данных из научных текстов

В научных публикациях числовые данные играют ключевую роль для сравнения технологий и уточнения моделей, однако они часто скрыты в тексте вместе с дополнительной информацией. С ростом объёмов литературы ручной сбор таких данных становится практически невозможным.

Для решения этой проблемы исследователи из Юлиха представили фреймворк Quinex (Quantitative Information Extraction), который автоматически распознаёт числа, связывает их с единицами измерения и восстанавливает контекст — что измерялось, где и как. Например, данные о предполагаемой эффективности в 2025 году преобразуются в структурированную запись с параметрами, диапазоном, годом и ссылкой на источник.

Quinex использует открытые языковые модели, что позволяет легко проверять, совершенствовать и запускать систему без дорогостоящей инфраструктуры. Этот подход обеспечивает высокую точность: около 98 % по F1 для чисел и единиц измерения, а также более 80 % для классификации параметров.

Тестирование системы проводилось на тысячах аннотаций из разных научных областей — энергетики, медицины, материаловедения и других. Разработчики подчёркивают, что Quinex не заменяет исследователя, а служит вспомогательным инструментом, позволяющим быстро находить и проверять числовые данные.

В дальнейшем команда планирует расширять возможности Quinex, добавляя новые датасеты и адаптируя систему под конкретные дисциплины. Проект будет доступен в открытом доступе, что позволит международному сообществу дорабатывать и применять инструмент в различных областях науки.