中文

FinDVer:面向长文本与混合内容金融文档的可解释主张验证

计算与语言 2024-11-11 v1 机器学习

摘要

我们引入了 FinDVer,一个专门设计的综合基准,用于评估大语言模型在理解和分析长文本、混合内容金融文档方面的可解释主张验证能力。FinDVer 包含 2,400 个专家标注样本,分为三个子集:信息抽取、数值推理和知识密集型推理,每个子集应对真实金融场景中常见的场景。我们在长上下文和检索增强生成(RAG)设置下评估了广泛的大语言模型。我们的结果表明,即使当前表现最好的系统 GPT-4o,仍落后于人类专家。我们进一步对长上下文和 RAG 设置、思维链推理以及模型推理错误进行了深入分析,以提供洞见推动未来进展。我们相信 FinDVer 可以作为评估大语言模型在复杂专业领域文档上进行主张验证的有价值基准。

关键词

引用

@article{arxiv.2411.05764,
  title  = {FinDVer: Explainable Claim Verification over Long and Hybrid-Content Financial Documents},
  author = {Yilun Zhao and Yitao Long and Yuru Jiang and Chengye Wang and Weiyuan Chen and Hongjun Liu and Yiming Zhang and Xiangru Tang and Chen Zhao and Arman Cohan},
  journal= {arXiv preprint arXiv:2411.05764},
  year   = {2024}
}

备注

EMNLP 2024