FAITH:评估金融领域表格数据内在幻觉的框架
机器学习
2025-10-27 v2 人工智能
计算与语言
摘要
幻觉仍是将大型语言模型 (LLM) 部署到金融领域的关键挑战。准确提取和精确计算表格数据对于可靠的金融分析至关重要,因为即使存在细微的数值错误也会削弱决策并影响合规性。金融应用具有独特要求,常依赖于依赖上下文的、数值型且专有的表格数据,而现有幻觉基准几乎未能捕捉这些特征。本研究开发了一个严格且可扩展的框架,用于评估金融 LLM 中的内在幻觉,将其概念化为对真实金融文件中掩码 span 预测的上下文感知任务。我们的主要贡献包括:(1) 一种新颖的、自动化的数据集创建方法,采用掩码策略;(2) 基于 S&P 500 年度报告衍生出的新的幻觉评估数据集;(3) 对金融表格数据中先进 LLM 内在幻觉模式的全面评估。我们的工作提供了可靠的内部分析方法,为构建更可信赖、更可靠的金融生成式人工智能系统奠定了关键步骤。
关键词
引用
@article{arxiv.2508.05201,
title = {FAITH: A Framework for Assessing Intrinsic Tabular Hallucinations in Finance},
author = {Mengao Zhang and Jiayu Fu and Tanya Warrier and Yuwen Wang and Tianhui Tan and Ke-wei Huang},
journal= {arXiv preprint arXiv:2508.05201},
year = {2025}
}
备注
9 pages, AMC ICAIF'25