Популярные нейросети пока плохо справляются с ролью персональных финансовых консультантов. В исследовании британской финтех-компании Saturn чат-боты в 57% случаев давали неверные ответы. На сложных задачах, требующих нескольких расчетов, доля ошибок достигла 88%.
Не доверяйте ИИ свои деньги: популярные модели ошибаются в 57% случаев при ответе на финансовые вопросы

Исследователи протестировали 18 популярных моделей, включая ChatGPT, Claude, Gemini, Copilot и Grok. Каждой предложили 121 финансовый вопрос, повторив его пять раз, чтобы проверить не только точность, но и стабильность ответов. Всего удалось собрать более 10 тысяч ответов.
Бизнес просит у государства миллиарды рублей: они пойдут на закупку оборудования для искусственного интеллекта
Искусственный интеллект отправят в космос: Илон Маск начнет запускать суперкомпьютеры Nvidia уже в 2027 году

При оценке учитывали не только математические и фактические ошибки. Ответ также признавали неудачным, если нейросеть упускала существенные условия или важные предупреждения, которые могли повлиять на финансовое решение пользователя.
Ошибки могли обойтись пользователям довольно дорого. Например, Claude Haiku 4.5 неправильно объяснила британские правила налогообложения пенсий. По расчетам Saturn, следование такому совету могло привести к дополнительному налоговому платежу в 17,5 тысячи фунтов. В другом случае Claude придумала правило, позволяющее выпускникам прекратить выплаты по студенческому кредиту после переезда за границу.
Проблемы обнаружились и с рекомендациями по погашению долгов. Некоторые модели советовали сначала закрывать кредиты с самыми высокими процентами, не учитывая задолженность по аренде жилья и муниципальным налогам. В Великобритании подобная ошибка может закончиться выселением или принудительным взысканием.

Платные версии справились с заданиями лучше бесплатных, но тоже часто ошибались — в 49% случаев против 63%. Даже у Claude Opus 5 в режиме рассуждений, показавшей наиболее высокий результат в тесте, исследователи забраковали 39% ответов.
Saturn призывает британский финансовый регулятор FCA усилить контроль за консультациями, которые предоставляют универсальные чат-боты. Сама компания разрабатывает ИИ-инструменты для профессиональных финансовых консультантов, поэтому у нее есть коммерческий интерес в результатах исследования и дальнейшем регулировании рынка.
При этом цифру 57% нельзя распространять на любые финансовые вопросы и все существующие нейросети. Исследование проводилось на ограниченном наборе задач, преимущественно связанных с британскими финансовыми правилами. Есть вероятность, что задачи были подкручены заинтересованной стороны, поэтому принимать на веру результаты исследования не стоит. Но даже если ИИ ошибается в 20% случаев, а не в 57%, это уже говорит о высоких рисках. Деньги чатботам доверять однозначно не стоит.
