RefereeBench:视频 MLLM 是否已准备好成为多体育裁判
计算机视觉与模式识别
2026-04-20 v1 计算与语言
摘要
虽然多模态大语言模型 (MLLM) 在通用视频理解方面表现出色,但其支持专门、以规则为依据的决策能力尚未得到充分探索。本文引入 RefereeBench,第一个大规模基准,用于评估 MLLM 作为自动体育裁判的能力。该基准涵盖 11 项体育项目,包含 925 个精选视频和 6,475 对 QA 对。RefereeBench 评估五项核心裁判能力:犯规是否存在、犯规与处罚分类、犯规与处罚推理、实体感知和时间定位。该基准完全由人工标注,确保标注质量高且基于真实的裁判逻辑和多模态证据。广泛评估显示,当前最先进的 MLLM 即便是最强模型(如豆包种子 1.8 和 Gemini-3-Pro),准确率也仅在约 60% 左右,而最强的开源模型 Qwen3-VL 仅达到 47%。这些结果表明,当前模型距离可靠的体育裁判仍有很大的距离。进一步分析显示,虽然模型通常能够识别事件和涉及实体,但在规则应用和时间定位方面仍感到困难,并且经常对正常片段过度判定犯规。我们的基准凸显了未来 MLLM 需要更好整合领域知识和多模态理解的需求,推动可信赖的 AI 辅助裁判及更广泛的多模态决策领域的发展。
引用
@article{arxiv.2604.15736,
title = {RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees},
author = {Yichen Xu and Yuanhang Liu and Chuhan Wang and Zihan Zhao and jinghan luo and Jianzhe Ma and Wenxuan Wang and Qin Jin},
journal= {arXiv preprint arXiv:2604.15736},
year = {2026}
}
备注
Work in Progress