Исследование: ИИ ошиблись в 88% сложных финансовых задач
21 сентября 2026, 17:10
1 просмотров
ForkLog
Популярные чат-боты ChatGPT, Claude, Copilot, Grok и Gemini в среднем дали неверные ответы на 57% финансовых запросов, выяснила технологическая компания Saturn. Исследователи проверили 18 моделей на 121 вопросе, получив более 10 000 ответов. На сложных задачах с несколькими расчетами доля ошибок выросла до 88%, а у отдельных моделей достигла 99%. Лучше всех выступила Claude Opus 5 в режиме рассуждений, но и она ошиблась в 39% случаев. В одном из тестов совет Claude Haiku 4.5 мог привести к налоговому штрафу в £17 500 (около $23 400).
OneLiners