无偏见学习:避免网络监督动作识别中的偏差
计算机视觉与模式识别
2017-09-08 v1
摘要
网络监督学习最近作为一种替代范式出现,以替代基于带有手动标注的大规模数据集的传统监督学习。其核心思想是诸如 CNN 等模型可以从网络上可用的含噪视觉数据中学习。在本工作中,我们旨在利用网络数据用于视频理解任务,如动作识别与检测。网络监督学习的主要问题之一是清理来自网络的含噪标注数据。现有最先进的范式依赖于先在含噪数据上训练第一个分类器,然后用它来清理剩余数据集。我们的关键洞察是,此过程会使第二个分类器偏向于第一个分类器能理解的样本。在此,我们训练两个独立的 CNN:一个是在网络图像和视频帧上训练的 RGB 网络,另一个是使用来自光流的时序信息的网络。我们表明,独立训练这些网络远优于使用我们的 RGB 网络为光流分类器选择帧。此外,我们展示了用来自异构公共网络数据库的不同数据源丰富训练集的益处。我们证明了我们的框架在两个公开基准 UCF-101 和 Thumos'14 上优于所有其他网络监督方法。
引用
@article{arxiv.1706.04589,
title = {Learning without Prejudice: Avoiding Bias in Webly-Supervised Action Recognition},
author = {Christian Rupprecht and Ansh Kapil and Nan Liu and Lamberto Ballan and Federico Tombari},
journal= {arXiv preprint arXiv:1706.04589},
year = {2017}
}
备注
Submitted to CVIU SI: Computer Vision and the Web