FAMMA:金融领域多语言多模态问答基准测试
计算与语言
2025-05-16 v4 人工智能
摘要
本文介绍了 FAMMA,这是一个开源的金融领域多语言多模态问答(Financial Multilingual Multimodal Question Answering)基准测试。我们的基准测试旨在评估大型语言模型(LLM)在回答需要高级金融知识才能解答的复杂推理问题方面的能力。该基准测试包含两个版本:FAMMA-Basic 由从大学教材和考试中提取的 1,945 个问题组成,配有人工标注的答案和理由;FAMMA-LivePro 由人工领域专家创建的 103 个新问题组成,其答案和理解在公开出版物中保留,以确保无污染的评估。这些问题涵盖金融八大主要子领域的高级知识(如公司金融、衍生品和投资组合管理)。其中一些问题为中文或法语,而大多数为英文。每个问题都包含一些非文本数据,如图表、图示或表格。我们的实验表明,FAMMA 对包括 GPT-o1 和 DeepSeek-R1 等推理模型构成重大挑战。此外,我们精选了 DeepSeek-R1 在 FAMMA-Basic 数据上的 1,270 条推理轨迹,并基于此推理数据对一系列开源 Qwen 模型进行微调。我们发现,在这些推理轨迹上训练模型可显著提升其在 FAMMA-LivePro 上的性能。我们已在 https://famma-bench.github.io/famma/ 上发布了排行榜、数据、代码和训练好的模型。
引用
@article{arxiv.2410.04526,
title = {FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering},
author = {Siqiao Xue and Xiaojing Li and Fan Zhou and Qingyang Dai and Zhixuan Chu and Hongyuan Mei},
journal= {arXiv preprint arXiv:2410.04526},
year = {2025}
}