MME-Finance:面向专家级理解与推理的多模态金融基准
计算机视觉与模式识别
2024-11-06 v1 计算与语言
摘要
近年来,通用领域的多模态基准指导了多模态模型在通用任务上的快速发展。然而,金融领域具有其特殊性。它具有独特的图形图像(例如 K 线图、技术指标图),并拥有丰富的专业金融知识(例如期货、换手率)。因此,来自通用领域的基准通常无法衡量多模态模型在金融领域的性能,从而无法有效指导大型金融模型的快速发展。为推动大型金融多模态模型的发展,我们提出了 MME-Finance,一个双语、开放式且面向实际应用的视觉问答 (VQA) 基准。我们基准的特点是金融性和专业性,包括构建反映用户实际使用需求的图表(例如电脑截图和手机拍摄),根据金融领域查询的偏好创建问题,并由拥有 10 多年金融行业经验的专家进行标注。此外,我们开发了一个定制设计的金融评估系统,在多模态评估过程中首次引入了视觉信息。我们对 19 个主流 MLLM 进行了广泛的实验评估,以测试其感知、推理和认知能力。结果表明,在通用基准上表现良好的模型在 MME-Finance 上表现不佳;例如,表现最好的开源和闭源模型分别获得 65.69 (Qwen2VL-72B) 和 63.18 (GPT-4o)。它们在与金融最相关的类别中表现尤为不佳,例如 K 线图和技术指标图。此外,我们提出了一个中文版本,有助于比较 MLLM 在中文语境下的表现。
引用
@article{arxiv.2411.03314,
title = {MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning},
author = {Ziliang Gan and Yu Lu and Dong Zhang and Haohan Li and Che Liu and Jian Liu and Ji Liu and Haipang Wu and Chaoyou Fu and Zenglin Xu and Rongjunchen Zhang and Yong Dai},
journal= {arXiv preprint arXiv:2411.03314},
year = {2024}
}
备注
Project Page: https://hithink-research.github.io/MME-Finance/