VisFinEval:面向中文多模态金融理解的情景驱动基准
计算工程、金融与科学
2025-08-14 v1
摘要
多模态大语言模型(MLLMs)在自动化复杂金融分析方面具有巨大的潜力。为全面评估其能力,我们引入 VisFinEval——第一个涵盖金融任务全链路(前中后 office)生命周期的大规模中文基准测试。VisFinEval 包含 15,848 组标注好的问答对,来自八种常见金融图像模态(如 K 线图、财务报表、官方公章),并组织为三个分层情景深度:金融知识与数据分析、金融分析与决策支持、金融风险控制与资产优化。我们以 zero-shot 设置评估了 21 个最新的 MLLMs。排名第一的模型 Qwen-VL-max 实现了 76.3% 的总体准确率,超越非专家人类,但与金融专家相差超过 14 个百分点。我们的错误分析揭示了六类常见的失败模式——包括跨模态错位、幻觉以及业务流程推理缺失——这些发现为未来研究指出了关键方向。VisFinEval 旨在加速面向金融领域的 MLLMs 开发,使其能够无缝集成文本与视觉金融信息。数据和代码已公开于 https://github.com/SUFE-AIFLM-Lab/VisFinEval。
引用
@article{arxiv.2508.09641,
title = {VisFinEval: A Scenario-Driven Chinese Multimodal Benchmark for Holistic Financial Understanding},
author = {Zhaowei Liu and Xin Guo and Haotian Xia and Lingfeng Zeng and Fangqi Lou and Jinyi Niu and Mengping Li and Qi Qi and Jiahuan Li and Wei Zhang and Yinglong Wang and Weige Cai and Weining Shen and Liwen Zhang},
journal= {arXiv preprint arXiv:2508.09641},
year = {2025}
}