ChineseVideoBench:面向中文视频问答的多模态大模型基准测试
计算机视觉与模式识别
2025-11-25 v1
摘要
本文介绍了ChineseVideoBench,这是一个专为评估多模态大语言模型(MLLMs)在中文视频问答任务中表现而设计的先驱性基准测试。随着对高级视频分析能力的日益增长的需求,对于提供全面且具有文化背景的评估框架变得至关重要。ChineseVideoBench通过提供稳健的数据集和量身定制的评估指标,为在复杂中文视频内容上对当前先进MLLMs进行严格评估提供了可能性。具体而言,ChineseVideoBench包含8大类别和12子类别,涵盖需要深入视频理解和细腻中文语言及文化意识的任务。我们的实证评估表明,ChineseVideoBench对当前MLLMs构成了重大挑战。在所评估的模型中,Gemini 2.5 Pro取得了最高的性能,总体得分为77.9%,而InternVL-38B则表现为最具竞争力的开源模型。
引用
@article{arxiv.2511.18399,
title = {ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering},
author = {Yuxiang Nie and Han Wang and Yongjie Ye and Haiyang Yu and Weitao Jia and Tao Zeng and Hao Feng and Xiang Fei and Yang Li and Xiaohui Lv and Guozhi Tang and Jingqun Tang and Jinghui Lu and Zehui Dai and Jiacong Wang and Dingkang Yang and An-Lan Wang and Can Huang},
journal= {arXiv preprint arXiv:2511.18399},
year = {2025}
}