Не доверяйте ИИ свои деньги: популярные модели ошибаются в 57% случаев при ответе на финансовые вопросы

Если доверить свои финансы искусственному интеллекту, можно вскоре остаться без финансов.
Антон Попов
Антон Попов
Не доверяйте ИИ свои деньги: популярные модели ошибаются в 57% случаев при ответе на финансовые вопросы
Magnific

Популярные нейросети пока плохо справляются с ролью персональных финансовых консультантов. В исследовании британской финтех-компании Saturn чат-боты в 57% случаев давали неверные ответы. На сложных задачах, требующих нескольких расчетов, доля ошибок достигла 88%.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Исследователи протестировали 18 популярных моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok. Каждой предложили 121 финансовый вопрос, повторив его пять раз, чтобы проверить не только точность, но и стабильность ответов. Всего удалось собрать более 10 тысяч ответов.

Magnific
Продолжение ниже Продолжение

При оценке учитывали не только математические и фактические ошибки. Ответ также признавали неудачным, если нейросеть упускала существенные условия или важные предупреждения, которые могли повлиять на финансовое решение пользователя.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Ошибки могли обойтись пользователям довольно дорого. Например, Claude Haiku 4.5 неправильно объяснила британские правила налогообложения пенсий. По расчетам Saturn, следование такому совету могло привести к дополнительному налоговому платежу в 17,5 тысячи фунтов. В другом случае Claude придумала правило, позволяющее выпускникам прекратить выплаты по студенческому кредиту после переезда за границу.

Проблемы обнаружились и с рекомендациями по погашению долгов. Некоторые модели советовали сначала закрывать кредиты с самыми высокими процентами, не учитывая задолженность по аренде жилья и муниципальным налогам. В Великобритании подобная ошибка может закончиться выселением или принудительным взысканием.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
Magnific

Платные версии справились с заданиями лучше бесплатных, но тоже часто ошибались — в 49% случаев против 63%. Даже у Claude Opus 5 в режиме рассуждений, показавшей наиболее высокий результат в тесте, исследователи забраковали 39% ответов.

Saturn призывает британский финансовый регулятор FCA усилить контроль за консультациями, которые предоставляют универсальные чат-боты. Сама компания разрабатывает ИИ-инструменты для профессиональных финансовых консультантов, поэтому у нее есть коммерческий интерес в результатах исследования и дальнейшем регулировании рынка.

При этом цифру 57% нельзя распространять на любые финансовые вопросы и все существующие нейросети. Исследование проводилось на ограниченном наборе задач, преимущественно связанных с британскими финансовыми правилами. Есть вероятность, что задачи были подкручены заинтересованной стороны, поэтому принимать на веру результаты исследования не стоит. Но даже если ИИ ошибается в 20% случаев, а не в 57%, это уже говорит о высоких рисках. Деньги чатботам доверять однозначно не стоит. 

Загружаем