用于半监督视频动作检测的稳定均值教师框架
计算机视觉与模式识别
2024-12-24 v2
摘要
在本文中,我们专注于视频动作检测的半监督学习。视频动作检测除了需要分类外,还需要时空定位,而有限的标签使模型容易产生不可靠的预测。我们提出了稳定均值教师(Stable Mean Teacher),一个简单的端到端基于教师的框架,受益于改进且时间一致的伪标签。它依赖于一种新颖的错误恢复(EoR)模块,该模块从学生在标注样本上的错误中学习,并将这些知识传递给教师以改进无标签样本的伪标签。此外,现有的时空损失不考虑时间一致性,容易产生时间不一致性。为了解决这个问题,我们提出了像素差分(DoP),一种简单而新颖的聚焦于时间一致性的约束,从而产生连贯的时间检测结果。我们在四个不同的时空检测基准上评估了我们的方法:UCF101-24、JHMDB21、AVA和YouTube-VOS。我们的方法在UCF101-24上以平均23.5%的优势超越了监督基线,在JHMDB21上以16%,在AVA上以3.3%。仅使用10%和20%的数据,它在UCF101-24和JHMDB21上分别提供了与使用100%标注训练的监督基线相当的性能。我们进一步评估了它在AVA上扩展到大规模数据集以及在YouTube-VOS上进行视频对象分割的有效性,证明了其在视频领域其他任务上的泛化能力。代码和模型公开发布。
引用
@article{arxiv.2412.07072,
title = {Stable Mean Teacher for Semi-supervised Video Action Detection},
author = {Akash Kumar and Sirshapan Mitra and Yogesh Singh Rawat},
journal= {arXiv preprint arXiv:2412.07072},
year = {2024}
}
备注
AAAI Conference on Artificial Intelligence, Main Technical Track (AAAI), 2025, Code: https://github.com/AKASH2907/stable_mean_teacher