SPORTU:面向多模态大语言模型的综合性体育理解基准
计算机视觉与模式识别
2025-03-18 v4 计算与语言
摘要
多模态大语言模型(Multimodal Large Language Models, MLLMs)正不断提升对复杂体育情景的推理能力,实现了文本与视觉信息的深度融合。为全面评估其能力,本文引入SPORTU基准,旨在评估MLLMs在多层次体育推理任务中的表现。SPORTU包含两个核心组成部分:SPORTU-text包含900个多选问答题,配有人工标注的解释,测试模型对规则理解和策略推理的能力。该组件聚焦于仅通过问答(QA)方式测试模型的推理能力,无需视觉输入;SPORTU-video包含7种运动的1701段慢动作视频片段,以及12048个问答对,旨在评估从基础体育识别到Foul检测与规则应用等多层次推理能力。我们在SPORTU-text部分评估了四个主流大语言模型,主要采用少量样本学习范式辅以链式思维(Chain-of-Thought, CoT)提示。我们评估了四个大语言模型,采用少量样本学习和链式思维(CoT)提示。在SPORTU-text部分,GPT-4o达到最高的71%准确率,但仍未达到人类水平,凸显了规则理解与推理仍有提升空间。在SPORTU-video部分的评估包括7个专有模型和6个开源模型。实验表明,模型在需要深层推理和规则化理解的难题上表现不足。Claude-3.5-Sonnet在难题上仅取得52.6%的准确率,显示出大大的提升空间。我们希望SPORTU能成为评估模型体育理解与推理能力的关键步骤。
引用
@article{arxiv.2410.08474,
title = {SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models},
author = {Haotian Xia and Zhengbang Yang and Junbo Zou and Rhys Tracy and Yuqing Wang and Chi Lu and Christopher Lai and Yanjun He and Xun Shao and Zhuoqing Xie and Yuan-fang Wang and Weining Shen and Hanjie Chen},
journal= {arXiv preprint arXiv:2410.08474},
year = {2025}
}
备注
ICLR 2025 Poster