从骨架到像素:通过表示与预测蒸馏实现的少样本精确事件定位
计算机视觉与模式识别
2026-04-28 v1 人工智能
摘要
精确事件定位(PES)是快速-paced 体育项目(如网球)中的关键技术,因而在非常短的时序窗口内发生细粒度事件。由于运动模糊、细微动作差异以及有限的标注数据,准确的帧级定位具有挑战性。我们研究了两种互补的蒸馏策略,用于少样本 PES:自适应权重蒸馏(AWD),这是一种在未标注数据上对教师监督进行自适应加权的预测层方法;以及 Annealed Multimodal Distillation for Few-Shot Event Detection(AMD-FED),这是一种通过退火式伪标签将稳健骨架知识传递到视觉模态的表示层框架。两种方法都使用多模态蒸馏以提高在受限监督下的泛化能力。在 F3Set-Tennis(sub) 数据集上进行少样本 k-clip 设置的评估表明,我们的方法在 consistently 超越单模态基线和先前 PES 方法。观察到表示层蒸馏在网球上表现更佳后,我们进一步在第二个运动数据集——滑冠项目中验证 AMD-FED,其在 k-clip 场景中也表现出稳健的性能。这些结果凸显了多模态蒸馏,尤其是表示层传递,对少样本精确事件定位的有效性。
引用
@article{arxiv.2604.22839,
title = {From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation},
author = {Zhong Han Ervin Yeoh and Jiang Kan},
journal= {arXiv preprint arXiv:2604.22839},
year = {2026}
}
备注
39 pages, 4 figures, ISACE 2026