RealBench:贴近真实场景的中文多图像理解基准
计算与语言
2025-09-23 v1 多媒体
摘要
虽然各种多模态多图像评估数据集不断涌现,但这些数据集主要基于英文,尚未有中文多图像数据集。为填补这一空白,我们介绍 RealBench,这是第一个中文多模态多图像数据集,包含 9393 个样本和 69910 张图像。RealBench 通过包含真实用户生成的内容,确保与真实应用场景高度相关。此外,该数据集涵盖多种场景、图像分辨率和图像结构,进一步增加了多图像理解的难度。最终,我们使用包含 21 个不同规模多模态大语言模型进行全面评估,包括支持多图像输入的闭源模型以及开源视觉和视频模型。实验结果表明,即便是最强大的闭源模型在处理中文多图像场景时也面临挑战。此外,开源视觉/视频模型与闭源模型之间仍存在约 71.8% 的显著性能差距。这些结果表明,RealBench 为进一步探索中文语境下多图像理解能力提供了重要研究基础。
引用
@article{arxiv.2509.17421,
title = {RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios},
author = {Fei Zhao and Chengqiang Lu and Yufan Shen and Qimeng Wang and Yicheng Qian and Haoxin Zhang and Yan Gao and Yi Wu and Yao Hu and Zhen Wu and Shangyu Xing and Xinyu Dai},
journal= {arXiv preprint arXiv:2509.17421},
year = {2025}
}
备注
Findings of EMNLP 2025 camera-ready