中文

FinReflectKG -- HalluBench:面向金融问答系统的图谱RAG幻觉基准

计算与语言 2026-03-24 v1 计算金融

摘要

随着组织越来越多地将 AI 驱动的问答系统集成到金融信息系统中用于合规、风险评估和决策支持,确保 AI 生成输出的事实准确性已成为关键的工程挑战。当前的知识图谱 (KG) 增强问答系统缺乏系统性的幻觉检测机制——即事实错误的输出,削弱了可靠性和用户信任。我们引入 FinBench-QA-Hallucination,一个用于评估 KG 增强金融问答中幻觉检测方法的基准数据集。该数据集包含 755 个标注实例,来自 300 页 SEC 10-K 文件,每个实例都使用保守的证据链路协议进行标注,要求支持来自文本块和提取的关系三元组。我们评估了六种检测方法——LLM 判官、微调分类器、自然语言推理 (NLI) 模型、片段检测器和基于嵌入的方法,在两种条件下:有无 KG 三元组。结果表明,LLM 基于判官和嵌入方法在干净条件下取得最高性能 (F1:0.82-0.86)。然而,大多数方法在引入噪声三元组后性能显著下降, Matthews 相关系数 (MCC) 下降 44-84 个百分点,而嵌入方法相对稳健,仅下降 9 个百分点。统计检验 (Cochran's Q 和 McNemar 检验) 确认了显著的性能差异 (p < 0.001)。我们的发现凸显了当前 KG 增强系统的脆弱性,并为构建可靠的金融信息系统提供了见解,其中幻觉可能导致监管违规和错误决策。该基准还为在医疗、法律和政府等其他高风险领域整合 AI 可靠性评估提供了框架。

关键词

引用

@article{arxiv.2603.20252,
  title  = {FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems},
  author = {Mahesh Kumar and Bhaskarjit Sarmah and Stefano Pasquali},
  journal= {arXiv preprint arXiv:2603.20252},
  year   = {2026}
}