Исследование: AI-модели ошибаются более чем в половине финансовых консультаций AI все чаще используют для вопросов, где ошибка измеряется уже не качеством текста, а деньгами: налоги, ипотека, пенсионные накопления, инвестиции. Насколько надежны такие советы, решила проверить британская финтех-компания Saturn. Как пишет Financial Times, 18 популярных AI-моделей протестировали на 121 вопросе о налогах, пенсиях, ипотеке, долгах и сбережениях. Каждый вопрос задавали пять раз, а всего исследователи проанализировали более 10 000 ответов. Результаты оказались такими: 🔹 В среднем модели давали неверные ответы в 57% случаев. 🔹 На сложных вопросах доля ошибок в среднем доходила до 88%. Особенно плохо модели справлялись с задачами, где нужно было одновременно учитывать несколько налоговых правил и проводить расчеты. 🔹 Бесплатные модели ошибались чаще платных: 63% против 49%. Но и подписка сама по себе не гарантировала надежного результата. Причем проблема не сводилась к небольшим погрешностям. Модели ошибались в расчетах, пропускали существенные финансовые риски, использовали устаревшие налоговые правила и ссылались на несуществующие нормы. В одном из примеров Claude Haiku 4.5 неверно ответил на вопрос о пенсионном налогообложении. Следование такой рекомендации, по расчетам исследователей, могло привести к налоговым обязательствам на £17 500. Особенно показательно, что подобными советами люди уже активно пользуются. В другом британском исследовании Capital One UK 13% опрошенных сообщили, что за последний год обращались к AI за информацией или советами по личным финансам. Столько же респондентов обращались за ними к родителям. При этом результаты Saturn стоит интерпретировать аккуратно. Это исследование финтех-компании, а не независимая академическая работа, поэтому показатель 57% нельзя автоматически переносить на любые AI-системы и сценарии их использования. Но сами типы обнаруженных ошибок хорошо показывают ограничения моделей там, где ответ требует актуальных правил, точных расчетов и учета множества условий. 📌 Вывод AIRu: главный риск в таких сценариях – не очевидно неверный ответ, а убедительно сформулированная ошибка, которую пользователь принимает за экспертную рекомендацию. В корпоративных системах для финансов, налогов и других чувствительных областей AI разумно использовать вместе с проверенными источниками, контролем расчетов и верификацией критичных решений специалистом. AIRu в VK AIRu в MAX AIRu в Tg