中文

FCMBench:面向实际应用的首个大规模金融信用多模态基准

计算机视觉与模式识别 2026-03-16 v3 人工智能 计算工程、金融与科学 多媒体

摘要

FCMBench 是首个大规模且符合隐私要求的多模态金融信用基准,涵盖特定领域工作流程和约束下的任务与鲁棒性挑战。当前版本的 FCMBench 覆盖 26 种证书类型,包含 5198 份隐私合规图像和 13806 份对应的 VQA 样本。它在真实世界的鲁棒性干扰下评估模型的感知与推理能力,包括 3 项基础感知任务、4 项信用相关推理任务(要求对决策导向的视觉证据进行解释),以及 10 项用于严格鲁棒性压力测试的实际挑战。此外,FCMBench 通过场景感知地捕获手动合成模板图像,实现隐私合规的真实性,无需公开发布任何图像。我们对 28 个最先进的视觉语言模型进行了广泛评估,涵盖 14 家 AI 公司和研究机构。其中,Gemini 3 Pro 以 65.16 的 F1 分数取得商业模型最佳成绩,Kimi-K2.5 以 60.58 的分数取得开源基线最佳成绩。所有测试模型的均值和标准差分别为 44.8 和 10.3,表明 FCMBench 具有较高的难度,能够有效区分现代视觉语言模型的能力。鲁棒性评估显示,即便是表现最好的模型在所设计的挑战下也会出现显著的性能下降。我们已开源该基准,以推动信用领域的 AI 研究,并为实际应用提供特定于领域的任务。

关键词

引用

@article{arxiv.2601.00150,
  title  = {FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications},
  author = {Yehui Yang and Dalu Yang and Fangxin Shang and Wenshuo Zhou and Jie Ren and Yifan Liu and Haojun Fei and Qing Yang and Yanwu Xu and Tao Chen},
  journal= {arXiv preprint arXiv:2601.00150},
  year   = {2026}
}