中文

TimeSoccer:用于足球解说生成的端到端多模态大语言模型

计算机视觉与模式识别 2025-04-30 v3 计算与语言

摘要

足球是全球范围内流行的体育项目,通常以持久的比赛和 distinctive的高光时刻为特征。近期发展的多模态大语言模型(MLLM)在时序定位和视频理解方面展现出具有前景的能力,但足球解说生成需要对长视频进行精确的时间局部化和语义丰富的描述。然而,现有的足球MLLM常依赖于时序先验进行字幕生成,无法端到端处理足球视频。某些传统方法遵循两步范例,复杂且未能捕获全局上下文,导致性能 suboptimal。为解决上述问题,我们提出TimeSoccer,这是首个用于单锚点稠密视频字幕生成(SDVC)的端到端足球MLLM,覆盖完整比赛的足球视频。TimeSoccer在单次前向传递中联合预测时间戳和生成字幕,实现对45分钟比赛的全局上下文建模。为支持足球比赛的长视频理解,我们引入MoFA-Select,一种基于粗到细策略的训练-free、运动感知帧压缩模块,自适应选择具有代表性的帧,并融合互补训练范例以增强模型处理长时序序列的能力。广泛的实验表明,我们的TimeSoccer在SDVC任务上实现了州际领先(SoTA)性能,以端到端形式生成高质量的解说,具有准确的时间对齐和强大的语义相关性。

关键词

引用

@article{arxiv.2504.17365,
  title  = {TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation},
  author = {Ling You and Wenxuan Huang and Xinni Xie and Xiangyi Wei and Bangyan Li and Shaohui Lin and Yang Li and Changbo Wang},
  journal= {arXiv preprint arXiv:2504.17365},
  year   = {2025}
}