中文

FinLFQA:评估 LLM 在金融长篇问答中的 attributed 文本生成

计算与语言 2025-10-09 v1

摘要

大型语言模型(LLM)经常对长篇问题产生幻觉,生成看似合理但事实错误的答案。常见的缓解策略是为LLM输出提供归因。然而,现有基准主要关注简易归因,即检索支持文本作为参考。我们认为,在现实场景中的金融应用中,归因超越了参考检索。我们引入FinLFQA,旨在评估LLM生成对复杂金融问题的长篇答案能力,同时提供可靠且细致的归因。FinLFQA通过人工标注评估归因的三个关键方面:(1)从财报中提取的支持证据,(2)中间数值推理步骤,(3)信息领域的金融知识以inform推理过程。我们进一步提供覆盖答案质量和归因质量的自动评估框架。通过对八个LLM进行大规模实验,我们发现细粒度指标对于区分模型能力至关重要,端到端生成的性能相当于事后方法,迭代细化只有在受到外部反馈指导时才有帮助。

关键词

引用

@article{arxiv.2510.06426,
  title  = {FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering},
  author = {Yitao Long and Tiansheng Hu and Yilun Zhao and Arman Cohan and Chen Zhao},
  journal= {arXiv preprint arXiv:2510.06426},
  year   = {2025}
}

备注

EMNLP 2025 Findings