В научных публикациях числовые данные играют ключевую роль для сравнения технологий и уточнения моделей, однако они часто скрыты в тексте вместе с дополнительной информацией. С ростом объёмов литературы ручной сбор таких данных становится практически невозможным.
Для решения этой проблемы исследователи из Юлиха представили фреймворк Quinex (Quantitative Information Extraction), который автоматически распознаёт числа, связывает их с единицами измерения и восстанавливает контекст — что измерялось, где и как. Например, данные о предполагаемой эффективности в 2025 году преобразуются в структурированную запись с параметрами, диапазоном, годом и ссылкой на источник.
Quinex использует открытые языковые модели, что позволяет легко проверять, совершенствовать и запускать систему без дорогостоящей инфраструктуры. Этот подход обеспечивает высокую точность: около 98 % по F1 для чисел и единиц измерения, а также более 80 % для классификации параметров.
Тестирование системы проводилось на тысячах аннотаций из разных научных областей — энергетики, медицины, материаловедения и других. Разработчики подчёркивают, что Quinex не заменяет исследователя, а служит вспомогательным инструментом, позволяющим быстро находить и проверять числовые данные.
В дальнейшем команда планирует расширять возможности Quinex, добавляя новые датасеты и адаптируя систему под конкретные дисциплины. Проект будет доступен в открытом доступе, что позволит международному сообществу дорабатывать и применять инструмент в различных областях науки.