VideoAutoArena:通过用户模拟评估大型多模态模型视频分析能力的自动化竞技场
摘要
具备先进视频分析能力的大型多模态模型(LMMs)近期引起了广泛关注。然而,大多数评估依赖于 VideoMME 和 LongVideoBench 等基准测试中的多项选择题等传统方法,这些方法缺乏捕捉真实用户复杂需求的深度。为解决这一局限性——且考虑到视频任务中人工标注成本高昂且速度缓慢——我们引入了 VideoAutoArena,这是一个受 LMSYS Chatbot Arena 框架启发的竞技场式基准测试,旨在自动评估 LMMs 的视频分析能力。VideoAutoArena 利用用户模拟生成开放式、自适应的问题,以严格评估模型在视频理解方面的表现。该基准测试具有自动化、可扩展的评估框架,并采用了改进的 ELO 评级系统,以在多个 LMMs 之间进行公平且连续的比较。为了验证我们的自动评判系统,我们使用精心筛选的人工标注子集构建了一个“黄金标准”,结果表明我们的竞技场与人类判断高度一致,同时保持了可扩展性。此外,我们引入了一种故障驱动演化策略,通过逐步增加问题复杂度,推动模型应对更具挑战性的视频分析场景。实验结果表明,VideoAutoArena 能够有效区分 SOTA LMMs,并深入揭示模型的优势与待改进之处。为了进一步简化评估流程,我们引入了 VideoAutoBench 作为辅助基准测试,由人工标注员在 VideoAutoArena 的部分对战中标记胜者。我们使用 GPT-4o 作为评判模型,将模型的回复与这些经人工验证的答案进行比较。VideoAutoArena 和 VideoAutoBench 共同提供了一个经济高效且可扩展的框架,用于评估以用户为中心的视频分析中的 LMMs。
引用
@article{arxiv.2411.13281,
title = {VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation},
author = {Ziyang Luo and Haoning Wu and Dongxu Li and Jing Ma and Mohan Kankanhalli and Junnan Li},
journal= {arXiv preprint arXiv:2411.13281},
year = {2025}
}
备注
CVPR 2025, Project Page: https://videoautoarena.github.io/