足球高光视频的注释生成
计算机视觉与模式识别
2025-08-12 v1 机器学习
摘要
自动化足球注释生成经历从模板系统向高级神经网络架构的演进,旨在生成实时描述体育事件的文本。尽管 SoccerNet-Caption 等框架奠定了基础工作,但其无法实现视频内容与注释之间的细粒度对齐仍是显著挑战。近期研究如 MatchTime,搭载其 MatchVoice 模型,通过粗粒度和细粒度对齐技术实现了改进的时间同步。本文将 MatchVoice 扩展至足球高光视频注释生成,采用强调短片段而非整场比赛的 GOAL 数据集。我们进行大量实验以复现原始 MatchTime 结果并评估我们的设置,突出不同训练配置和硬件限制的影响。此外,我们探讨了不同窗口大小对零样本性能的影响。虽然 MatchVoice 显示出有前景的泛化能力,但我们的发现表明,需要整合更广泛视频语言领域的技术以进一步提升性能。我们的代码已公开于 https://github.com/chidaksh/SoccerCommentary。
关键词
引用
@article{arxiv.2508.07543,
title = {Commentary Generation for Soccer Highlights},
author = {Chidaksh Ravuru},
journal= {arXiv preprint arXiv:2508.07543},
year = {2025}
}