MT-Video-Bench:面向多轮对话的多模态LLM视频理解综合基准
计算机视觉与模式识别
2026-01-09 v2 人工智能
摘要
最近的多模态大语言模型(MLLM)显著推进了AI处理视觉模态的能力,但现有评估基准局限于单轮问答,忽略了现实场景中多轮对话的复杂性。为弥合这一差距,我们引入MT-Video-Bench,一个用于评估MLLM在多轮对话中视频理解的综合性基准。具体而言,MT-Video-Bench主要评估6项核心能力,聚焦于感知与交互,涵盖来自多个领域的1000个精心策划的多轮对话。这些能力严格对齐现实应用场景,如交互式体育分析和多轮基于视频的智能辅导。通过MT-Video-Bench,我们广泛评估了各种最新开源和闭源MLLM,揭示其在处理多轮视频对话方面存在显著的性能差异和局限性。该基准将对外公开,以促进未来研究。
引用
@article{arxiv.2510.17722,
title = {MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues},
author = {Yaning Pan and Qianqian Xie and Guohui Zhang and Zekun Wang and Yongqian Wen and Yuanxing Zhang and Haoxuan Hu and Zhiyu Pan and Yibing Huang and Zhidong Gan and Yonghong Lin and An Ping and Shihao Li and Yanghai Wang and Tianhao Peng and Jiaheng Liu},
journal= {arXiv preprint arXiv:2510.17722},
year = {2026}
}
备注
Project Website: https://github.com/NJU-LINK/MT-Video-Bench