Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье

Habr ·

Почему нельзя просто загрузить историю с фитнес-браслета в LLM и попросить оценить здоровье

Исследователи из Meta и KAIST решили проверить очевидный на первый взгляд вопрос: если дать большой языковой модели реальную историю измерений с фитнес-трекера — пульс, сон, шаги за полгода — сможет ли она разобраться в этих данных так же уверенно, как рассуждает о здоровье вообще? Результат оказался неожиданным. Модели гораздо хуже справлялись с простыми вычислениями по самим цифрам, чем с клинической интерпретацией того же ряда. GPT-4o правильно считал тренды и аномалии лишь в четверти случаев, а вот рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее. Логика подсказывает обратное: клиническая интерпретация — это высокий уровень, требующий знаний и осторожности, а посчитать среднее значение или найти всплеск в ряду чисел — задача попроще, почти техническая. Оказывается, для языковых моделей все устроено иначе, и разрыв между этими двумя навыками — системная проблема, которую авторы бенчмарка WearableQA зафиксировали на 14 моделях сразу. Разбираемся, что именно это значит для тех, кто планирует доверить ИИ анализ собственных данных о здоровье. Читать дальше

Исследователи из Meta и KAIST решили проверить очевидный на первый взгляд вопрос: если дать большой языковой модели реальную историю измерений с фитнес-трекера — пульс, сон, шаги за полгода — сможет ли она разобраться в этих данных так же уверенно, как рассуждает о здоровье вообще? Результат оказался неожиданным. Модели гораздо хуже справлялись с простыми вычислениями по самим цифрам, чем с клинической интерпретацией того же ряда. GPT-4o правильно считал тренды и аномалии лишь в четверти случаев, а вот рассуждал о рисках для здоровья на основе тех же данных вдвое увереннее. Логика подсказывает обратное: клиническая интерпретация — это высокий уровень, требующий знаний и осторожности, а посчитать среднее значение или найти всплеск в ряду чисел — задача попроще, почти техническая. Оказывается, для языковых моделей все устроено иначе, и разрыв между этими двумя навыками — системная проблема, которую авторы бенчмарка WearableQA зафиксировали на 14 моделях сразу. Разбираемся, что именно это значит для тех, кто планирует доверить ИИ анализ собственных данных о здоровье. Читать дальше

Источник: Habr