新留园 海外华人的新闻与社区
论坛 新闻时事 警惕“AI幻觉”:研究揭示主流大模型在财务领域错误率高达57%

警惕“AI幻觉”:研究揭示主流大模型在财务领域错误率高达57%

小新 正二品 (尚书) 楼主
2026-09-23 00:20
第1楼

【核心提要】

  • 研究显示,包括ChatGPT、Claude、Gemini等在内的主流AI模型在回答财务相关问题时,平均有57%的答案存在错误。
  • 错误主要源于计算失误、忽略即将实施的税收政策变更以及凭空捏造规则(即“幻觉”)。
  • 虽然付费模型和新一代模型表现优于免费及旧款模型,但即便是性能最强的推理模型仍有约39%的错误率。

【正文报道】

近日,由Saturn发布的一项研究揭示了当前主流人工智能(AI)模型在处理专业财务领域问题时的显著局限性。研究表明,尽管大语言模型在通用对话和内容创作方面表现出色,但在涉及精确计算、法律条款及实时政策更新的财务场景中,其可靠性仍面临严峻挑战。

该项研究通过对100多个涵盖不同复杂程度的财务问题进行测试,覆盖了包括ChatGPT、Claude、Copilot、Grok和Gemini在内的18种AI模型。为了确保数据的准确性,研究人员针对每个问题进行了多达五次的重复提问,累计生成了超过10,000条回答数据。测试范围涵盖了这些模型的免费版本及付费订阅版本,旨在对比不同技术层级的表现差异。

研究结果显示,在处理财务相关咨询时,AI模型平均有57%的回答是不正确的。具体错误类型主要分为三类:一是基础计算错误;二是未能识别或忽略即将实施的税收政策变动;三是产生“幻觉”,即模型会凭空捏造不存在的规则或条款来填充信息。研究警告称,在涉及税务等关键财务决策时,过度依赖AI生成的答案可能导致严重的经济损失。

在对比不同模型性能时,研究发现付费订阅版本(Paid Models)的准确率明显高于免费版,且较新的模型在逻辑推理上优于旧款模型。其中,被认为具备强大推理能力的Claude Opus 5表现最为出色,但在面对复杂的财务问题时,其错误率仍高达39%。

这一结果再次警示用户:尽管AI是强大的生产力工具,但在涉及法律、税务及精密计算等高风险领域时,必须由专业人员进行审核。目前的技术水平尚不足以让AI独立承担此类高度严谨的专业职能。

【小编观点】
此次研究再次敲响了“过度依赖AI”的警钟。特别是在财务和法律等容错率为零的专业领域,AI生成的答案应被视为“草稿”或“参考资料”,而非最终决策依据。对于企业用户而言,在引入AI辅助办公时,建立严格的人工审核机制(Human-in-the-loop)是规避潜在经济风险的关键。

背景链接:

0 条回复

暂无回复,快来抢沙发吧!

  • 1 / 1 页
敬请注意:文中内容观点和各种评论不代表本网立场!若有违规侵权,请联系我们