通过探索子概念从弱标注网络视频中学习
计算机视觉与模式识别
2021-01-12 v1
摘要
从海量弱标注网络视频中学习视觉知识因互联网上易获取的大型视频语料而吸引了日益增长的研究兴趣。然而,对于视频动作识别,感兴趣的动作可能仅存在于未修剪网络视频的任意片段中,导致时间空间上的高标签噪声。为解决此问题,我们引入一种使用检索的网络视频预训练视频动作识别模型的新方法。我们不是试图过滤掉,而是提出通过将检索视频中的潜在噪声转化为有用监督信号,定义子伪标签(Sub-Pseudo Label, SPL)的概念。具体而言,SPL 通过外推视频检索时的原始弱标签和从教师模型提炼的先验知识,拓展出一组新的有意义“中间地带”标签空间。因此,SPL 为视频模型提供丰富的监督以学习更好的表征。SPL 相当简单且与流行的教师-学生自训练框架正交,无需额外训练成本。我们在四个视频动作识别数据集和一个弱标注图像数据集上验证了我们方法的有效性,以研究泛化能力。实验表明,SPL 优于几种现有的使用伪标签的预训练策略,并且在 HMDB-51 和 UCF-101 上微调时,所学表征与近期预训练方法相比取得了有竞争力的结果。
引用
@article{arxiv.2101.03713,
title = {Learning from Weakly-labeled Web Videos via Exploring Sub-Concepts},
author = {Kunpeng Li and Zizhao Zhang and Guanhang Wu and Xuehan Xiong and Chen-Yu Lee and Zhichao Lu and Yun Fu and Tomas Pfister},
journal= {arXiv preprint arXiv:2101.03713},
year = {2021}
}