X-VARS:利用多模态大语言模型在足球裁判中引入可解释性
计算机视觉与模式识别
2025-02-18 v1
摘要
人工智能的快速发展显著提升了自动化决策能力。然而,模型性能的提高往往以牺牲其决策过程的可解释性和透明度为代价。本文以足球裁判为测试场景,鉴于其决策的复杂性与主观性,研究大语言模型解释决策的能力。我们提出了可解释视频助理裁判系统 (Explainable Video Assistant Referee System, X-VARS),这是一种多模态大语言模型,旨在从裁判视角理解足球视频。X-VARS 能够执行多种任务,包括视频描述、问答、动作识别,以及基于视频内容并遵循足球裁判规则进行有意义的对话。我们在新数据集 SoccerNet-XFoul 上对 X-VARS 进行了验证,该数据集包含超过 22,000 个由 70 多名经验丰富的足球裁判标注的视频-问答三元组。我们的实验和人类研究展示了 X-VARS 在解读复杂足球片段方面的出色能力。此外,我们强调了 X-VARS 在未来达到人类水平并辅助足球裁判的潜力。
引用
@article{arxiv.2404.06332,
title = {X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model},
author = {Jan Held and Hani Itani and Anthony Cioppa and Silvio Giancola and Bernard Ghanem and Marc Van Droogenbroeck},
journal= {arXiv preprint arXiv:2404.06332},
year = {2025}
}