Недостоверные данные в моделях ИИ для прогнозирования инсульта и диабета

Группа ученых под руководством Адриана Барнетта из Квинслендского технологического университета провела анализ, в результате которого выявила, что 124 рецензируемые статьи использовали два набора данных с сомнительным происхождением. Первый набор, заруженный на платформу Kaggle, содержит информацию о состоянии здоровья 5 110 участников, включая данные об истории сердечно-сосудистых заболеваний и уровне глюкозы в крови. Однако исследователи заметили, что в данных почти не было пропусков, что вызывает сомнения. Этот набор использовался в 104 исследованиях. Второй набор, касающийся диабета, включает информацию о 100 000 человек, но команда обнаружила, что в нем всего 18 уникальных значений уровня глюкозы, что также кажется неправдоподобным. Исследователи предупреждают, что использование недостоверных данных может привести к ошибочным диагнозам и решениям в лечении. Журнал Scientific Reports уже отозвал три статьи из-за сомнений в достоверности данных.