面向动作识别的 SV3.3B 运动视频理解模型
计算机视觉与模式识别
2025-08-26 v1 人工智能
摘要
本文聚焦于自动化体育视频分析的挑战,这类挑战长期受限于计算密集型模型需依赖服务器端处理且缺乏对运动员生物力学细微变化的理解。现有方法难以捕捉至关重要的准备、执行和收尾等关键阶段——这些阶段通常仅持续几秒。为此,我们引入 SV3.3B,一个轻量级 33 亿参数的视频理解模型,融合创新的时序运动差异抽样技术与自监督学习,实现高效的设备端部署。我们的方法采用 DWT-VGG16-LDA 基于小波变换的关键帧抽取机制,智能识别体育序列中最具代表性的 16 帧,随后通过基于掩码去噪目标的 V-DWT-JEPA2 编码器预训练,再配合专为体育动作描述生成微调的大语言模型解码器。经在 NSVA 篮球数据集子集上评估,SV3.3B 在传统文本生成指标和体育专用评估标准上均实现超越 GPT-4o 等大型封闭源模型的卓越表现,同时保持显著更低的计算开销。本模型在生成技术细致且分析富色彩的体育描述方面展现出卓越能力,在地面实况验证指标上较 GPT-4o 提升 29.2%,在信息密度、动作复杂度和测量精度等对综合性体育分析至关重要的指标上实现显著提升。模型已在 https://huggingface.co/sportsvision/SV3.3B 提供访问。
引用
@article{arxiv.2507.17844,
title = {SV3.3B: A Sports Video Understanding Model for Action Recognition},
author = {Sai Varun Kodathala and Yashwanth Reddy Vutukoori and Rakesh Vunnam},
journal= {arXiv preprint arXiv:2507.17844},
year = {2025}
}
备注
8 pages, 6 figures, 4 tables. Submitted to AIxSET 2025