中文

FinGround:通过原子命题验证检测并 grounding 金融幻觉

人工智能 2026-04-28 v1 计算与语言 信息检索

摘要

金融 AI 系统必须生成基于特定监管文件的文件,然而当前大语言模型会虚构指标、编造引用并误算派生数值。这些错误直接导致监管后果,欧盟 AI 法案的高风险执法截止日期即将到来(2026 年 8 月)。现有的幻觉检测器对所有命题统一处理,漏掉 43% 需要对结构表格进行算术重验证的计算错误。我们提出 FinGround,一个三阶段验证- grounding 流水线,用于金融文件问答。阶段 1 在文本和表格之间进行金融领域感知的混合检索。阶段 2 将答案分解为原子命题,通过六类型金融分类法对其进行分类,并通过包括公式重构在内的类型路由策略进行验证。阶段 3 用段落和表格单元格级别的引用重写不受支持的命题。为干净地隔离验证价值与检索质量,我们提出检索等化评估作为 RAG 验证研究的标准方法:即使所有系统接收相同的检索,FinGround 仍比最强基线降低幻觉率 68%(p<0.01p < 0.01)。完整管线相较于 GPT-4o 降低幻觉率 78%。一个 8B 蒸馏检测器在 18 倍更低的 per-claim 延迟下保留 91.4% F1 分数,使 0.0030.003/query 的部署成为可能,得到四周分析师试点情报的支持。

关键词

引用

@article{arxiv.2604.23588,
  title  = {FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification},
  author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
  journal= {arXiv preprint arXiv:2604.23588},
  year   = {2026}
}

备注

Accepted to ACL 2026 Industry Track. 14 pages, 1 figure, 14 tables