中文

期待意外:面向金融领域的容错长文本问答

计算与语言 2025-02-11 v1

摘要

我们提出了新的长文本金融基准测试——FailSafeQA,旨在测试大语言模型(LLM)在金融领域LLM-based查询-答系统中应对六种人机交互变体的鲁棒性和情境感知能力。我们聚焦两个案例研究:查询失败与情境失败。在查询失败场景中,我们扰动原始查询,使其在领域专业性、完整性和语言准确性上发生变化。在情境失败案例中,我们模拟上传退化、无关和空文档的情况。我们采用LLM-as-a-Judge方法,以Qwen2.5-72B-Instruct为评判标准,并采用细粒度评分标准来定义和计算鲁棒性、情境 grounding 和合规性得分,对24个成熟模型进行评估。结果表明,尽管某些模型在缓解输入扰动方面表现出色,但它们必须在稳健回答与避免幻觉之间取得平衡。值得注意的是,Palmyra-Fin-128k-Instruct作为最具合规性的模型,保持了强大的基线性能,但在17%的测试案例中在维持稳健预测方面遇到了挑战。相反,最具鲁棒性的模型OpenAI o3-mini在41%的测试案例中生成了虚假信息。结果表明,即使是表现优异的模型也有大量提升空间,凸显了FailSafeQA作为开发针对金融应用可靠性优化的大语言模型工具的作用。该数据集可在:https://huggingface.co/datasets/Writer/FailSafeQA 获取。

关键词

引用

@article{arxiv.2502.06329,
  title  = {Expect the Unexpected: FailSafe Long Context QA for Finance},
  author = {Kiran Kamble and Melisa Russak and Dmytro Mozolevskyi and Muayad Ali and Mateusz Russak and Waseem AlShikh},
  journal= {arXiv preprint arXiv:2502.06329},
  year   = {2025}
}