用于视频技能评估的学习技能属性
计算机视觉与模式识别
2025-11-19 v1
摘要
从视频中进行技能评估涉及对一个人身体表现质量的评估,并解释可以改进的地方。今天的模型针对单个运动项目进行专业化,且因专家级监督在运动项目的长尾分布中稀缺和高成本而受限。为弥合这一差距,我们探索用于技能评估的可迁移视频表示。我们的 CrossTrainer 方法发现技能属性,如平衡、控制和手部位置——其意义超越了任何单个运动项目的边界,然后训练一个多模态语言模型为新视频生成可操作的反馈,如“提升手部位置以产生更多动力”,以及其技能水平,如“早期专家”。我们在多个数据集上对该新模型进行了验证,进行 both cross-sport (迁移) 和 intra-sport (领域内) 设置测试,其中在迁移方面相较现有技术提升了最高可达 60%。通过抽象出人类技能的共享行为特征,所提出的视频表示在现有技术之上实现了显著的更好泛化,丰富了今天的多模态大语言模型。
引用
@article{arxiv.2511.13993,
title = {Learning Skill-Attributes for Transferable Assessment in Video},
author = {Kumar Ashutosh and Kristen Grauman},
journal= {arXiv preprint arXiv:2511.13993},
year = {2025}
}
备注
NeurIPS 2025, Project webpage: https://vision.cs.utexas.edu/projects/CrossTrainer/