面向视频动作检测的半监督主动学习
计算机视觉与模式识别
2024-04-04 v3
摘要
在本工作中,我们关注视频动作检测的标签高效学习。我们开发了一种新颖的半监督主动学习方法,该方法利用标记数据与未标记数据,并结合信息样本选择来进行动作检测。视频动作检测需要时空定位与分类,这给主动学习中的信息样本选择以及半监督学习中的伪标签生成带来了诸多挑战。首先,我们提出NoiseAug,这是一种简单的数据增强策略,能够有效地为视频动作检测选择信息样本。接着,我们提出fft-attention,这是一种基于高通滤波的新技术,通过强调视频内的相关活动区域,实现了在视频动作检测中有效利用半监督学习的伪标签。我们在三个不同的基准数据集UCF-101-24、JHMDB-21和Youtube-VOS上对所提方法进行了评估。首先,我们展示了其在视频动作检测上的有效性,所提方法在UCF101-24和JHMDB-21上均优于半监督与弱监督学习中的已有工作以及若干基线方法。其次,我们还展示了其在Youtube-VOS上进行视频目标分割的有效性,证明了其对视频中其他密集预测任务的泛化能力。代码与模型公开于:\url{https://github.com/AKASH2907/semi-sup-active-learning}。
引用
@article{arxiv.2312.07169,
title = {Semi-supervised Active Learning for Video Action Detection},
author = {Ayush Singh and Aayush J Rana and Akash Kumar and Shruti Vyas and Yogesh Singh Rawat},
journal= {arXiv preprint arXiv:2312.07169},
year = {2024}
}
备注
AAAI Conference on Artificial Intelligence, Main Technical Track (AAAI), 2024, Code: https://github.com/AKASH2907/semi-sup-active-learning