ai-assistants
Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье
Исследователи решили проверить очевидный на первый взгляд вопрос: если дать большой языковой модели реальную историю измерений с фитнес-трекера — пульс, сон, шаги за полгода — сможет ли она разобраться в этих данных так же уверенно, как рассуждает о здоровье вообще? Результат оказался неожиданным. Модели гораздо хуже справлялись с простыми вычислениями по самим цифрам, чем с клинической интерпретацией того же ряда. GPT-4o правильно считал тренды и аномалии лишь в четверти случаев, а вот рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее. Логика подсказывает обратное: клиническая интерпретация — это высокий уровень, требующий знаний и осторожности, а посчитать среднее значение или найти всплеск в ряду чисел — задача попроще, почти техническая.
Читать далее →