中文

OmViD: 面向视频动作检测的全 supervision 活动学习

计算机视觉与模式识别 2025-08-20 v1

摘要

视频动作检测需要密集的时空标注,这既具有挑战性又昂贵。然而,现实视频在难度上常有所不同,可能不需要相同的标注水平。本文分析了每个样本的合适标注类型及其对时空视频动作检测的影响。本研究聚焦于两个关键方面:1)如何为视频获取不同层次的标注,2)如何从不同类型的标注中学习动作检测。该研究探讨了视频级标签、点、线条、边界框和像素级掩码。首先,提出了一种简单的活动学习策略,用于估计每个视频所需的标注类型。然后,引入一种新颖的时空 3D 超像素方法,用于从这些标注生成伪标签,从而实现有效的训练。该方法在 UCF101-24 和 JHMDB-21 数据集上验证,显著降低了标注成本,同时保持最小的性能损失。

关键词

引用

@article{arxiv.2508.13983,
  title  = {OmViD: Omni-supervised active learning for video action detection},
  author = {Aayush Rana and Akash Kumar and Vibhav Vineet and Yogesh S Rawat},
  journal= {arXiv preprint arXiv:2508.13983},
  year   = {2025}
}

备注

ICCVW'25