Shot2Tactic-Caption:坦击视频的多尺度描述用于战术理解
计算机视觉与模式识别
2025-10-17 v1
摘要
坦击战术理解不仅涉及单个动作的解释,还涉及这些动作如何在时间上动态执行。本文提出了 Shot2Tactic-Caption,一个用于坦击视频语义和时序多尺度视频描述的新框架,能够生成描述单个动作的 shot 级别描述和捕捉这些动作如何在战术执行中随时间展开的 tactic 级别描述。我们还引入了 Shot2Tactic-Caption 数据集,这是第一个坦击描述数据集,包含 5,494 条 shot 描述和 544 条 tactic 描述。Shot2Tactic-Caption 采用双分支设计,两个分支均包括视觉编码器、时空 Transformer 编码器和基于 Transformer 的解码器,用于生成 shot 和 tactic 描述。为支持 tactic 描述,我们额外引入了 Tactic Unit 检测器,用于识别有效的 tactic 单元、tactic 类型和 tactic 状态(如中断、恢复)。对于 tactic 描述,我们进一步采用 shot 级别的提示引导机制,将预测的 tactic 类型和状态嵌入为提示,并通过跨注意力注入解码器。shot 级别的提示引导机制使我们的系统不仅能描述成功执行的战术,还能捕捉暂时中断后再恢复的战术执行。实验结果表明,我们的框架在生成 shot 和 tactic 描述方面有效。消融研究表明,基于 ResNet50 的时空编码器优于其他变体,而且 shot 级别的提示结构导致更连贯和准确的 tactic 描述。
引用
@article{arxiv.2510.14617,
title = {Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding},
author = {Ning Ding and Keisuke Fujii and Toru Tamaki},
journal= {arXiv preprint arXiv:2510.14617},
year = {2025}
}
备注
9 pages, 3 figures. Accepted to ACM MMSports 2025