中文

FCMR:金融跨模态多跳推理的鲁棒评估

计算与语言 2025-06-02 v4

摘要

现实世界的决策通常需要整合并推理来自多种模态的信息。尽管近期的多模态大语言模型(MLLM)在此类任务中展现出了潜力,但它们在跨不同来源进行多跳推理方面的能力仍未得到充分评估。现有的基准(如MMQA)面临挑战,原因在于(1)数据污染,以及(2)缺乏需要跨越两种以上模态进行操作的复杂查询,这阻碍了准确的性能评估。为了解决这一问题,我们提出了金融跨模态多跳推理(FCMR),这是一个旨在通过促使MLLM结合金融领域内文本报告、表格和图表中的信息来分析其推理能力的基准。FCMR被划分为三个难度级别——简单、中等和困难——以促进逐步评估。特别是,困难级别的问题需要精确的跨模态三跳推理,并且被设计为防止忽略任何模态。在这个新基准上的实验表明,即使是SOTA MLLM也面临困难,表现最好的模型(Claude 3.5 Sonnet)在最具挑战性的层级上仅达到30.4%的准确率。我们还进行了分析,以提供对模型内部运作的洞察,包括在信息检索阶段发现了一个关键瓶颈。

关键词

引用

@article{arxiv.2412.12567,
  title  = {FCMR: Robust Evaluation of Financial Cross-Modal Multi-Hop Reasoning},
  author = {Seunghee Kim and Changhyeon Kim and Taeuk Kim},
  journal= {arXiv preprint arXiv:2412.12567},
  year   = {2025}
}

备注

ACL 2025