从带噪网络视频中学习如何学习
计算机视觉与模式识别
2017-06-12 v1
摘要
理解同时具有高度多样性与精细粒度的各种人类动作,是计算机视觉中一个关键的开放问题。对于某些动作类别,人工标注训练视频是可行的,但这无法扩展到动作的完整长尾分布。解决此问题的一种有前景的方法是利用网络查询中的带噪数据,通过半监督或“网络监督”方法来学习新动作。然而,这些方法通常无法学习特定领域的知识,或依赖于迭代式的手工调参数据标注策略。在本工作中,我们转而提出一种基于强化学习的公式化方法,用于从带噪网络搜索结果中选择合适的样本来训练分类器。我们的方法使用 Q-learning 在一个小型有标注训练数据集上学习数据标注策略,然后利用该策略自动为新的视觉概念标注带噪网络数据。在具有挑战性的 Sports-1M 动作识别基准以及额外的细粒度与新出现的动作类别上的实验表明,我们的方法能够为带噪数据学习到良好的标注策略,并以此学习准确的视觉概念分类器。
引用
@article{arxiv.1706.02884,
title = {Learning to Learn from Noisy Web Videos},
author = {Serena Yeung and Vignesh Ramanathan and Olga Russakovsky and Liyue Shen and Greg Mori and Li Fei-Fei},
journal= {arXiv preprint arXiv:1706.02884},
year = {2017}
}
备注
To appear in CVPR 2017