Российские ученые предложили новый способ проверки диагностических медицинских моделей на базе искусственного интеллекта. Разработанная ими методика дает возможность сравнивать ответы нейросетей с мнением группы врачей в формате, максимально близком к реальной клинической практике. В результате они назвали три языковые модели, результаты работы которых были наиболее близки с мнением реальных специалистов.

© Global Look Press
Эксперимент проводили ученые НИИ искусственного интеллекта AIRI и НМИЦ имени Алмазова. Они разработали новый подход к оценке качества работы ИИ в медицинской диагностике.
В отличие от традиционных методов, где модель должна выбрать диагноз из заранее заданного списка, ученые предложили проверять нейросети в более реалистичном сценарии, когда диагноз формулируется в свободной форме, как это происходит в обычной работе врача. Кроме того, вместо сравнения ответа ИИ с одним диагнозом авторы сопоставили его с мнением группы специалистов. Такой подход, отмечают исследователи, позволяет точнее понять, насколько модель близка к врачебной практике и можно ли рассматривать ее как полноценного участника экспертной команды.
Исследование проводили на 360 медицинских диалогах врачей с пациентами. В материалах были зафиксированы реальные ситуации из амбулаторной практики: сбор жалоб и анамнеза, ответы пациента на вопросы врача. Для сравнения были выбраны наиболее известные языковые модели: GigaChat, Qwen, DeepSeek, GPT-4o, Mistral и Llamа. В экспертной оценке участвовали врачи-терапевты Центра Алмазова.
Чтобы корректно сопоставлять диагнозы, сформулированные в свободной форме, исследователи собрали датасет из 1500 пар диагнозов. На этом наборе данных ученые рассчитали стандартные метрики и показали, что сам алгоритм сопоставления диагнозов работает с точностью 98%. Все протестированные модели, кроме Llama 3.1 405B, оказались достаточно близки к мнению врачей, чтобы их можно было рассматривать как потенциальных участников экспертной группы.
Лучшие результаты показали GigaChat, DeepSeek и GPT-4o — они оказались на 13-16% ближе к ответам врачей, чем даже сами врачи друг к другу.
"Раньше на практике использовали стандартный анализ моделей, но он не всегда отражает реальное положение вещей. Новая методика призвана решить эту проблему. Единственное, сейчас она не учитывает порядок диагнозов по приоритету: первый и последний варианты в ответе имеют одинаковый вес, но мы работаем над решением этого вопроса. Параллельно развиваем еще одно прикладное направление — используем модель для автоматического подбора кодов международной классификации болезней по свободной формулировке диагноза. Датасет и код исследования выложены в открытый доступ, поэтому методику уже сейчас можно использовать как бенчмарк (эталонный показатель) для оценки новых медицинских ИИ-систем", — пояснил "РГ" старший научный сотрудник AIRI Илья Копаничук.
Медицинские учреждения и разработчики уже сегодня могут использовать новую методику для регулярного мониторинга качества медицинских ИИ- систем. Для врачей инструмент важен как способ более объективно отбирать ИИ-помощников, для пациентов — как шаг к более надежным и проверенным цифровым сервисам поддержки диагностики.
"В ближайшие годы такие методы оценки могут стать важной частью инфраструктуры здравоохранения, поскольку позволят внедрять ИИ, основываясь на прозрачных и воспроизводимых сравнениях их решений с клинической практикой", — заключил эксперт.