面向视频识别的全源网络监督学习
计算机视觉与模式识别
2020-08-26 v2
摘要
我们提出 OmniSource,一种利用网络数据训练视频识别模型的新框架。OmniSource 克服了图像、短视频和长未剪辑视频等数据格式在网络监督学习中的壁垒。首先,由任务特定数据收集整理、并经教师模型自动筛选的多格式数据样本被转换为统一形式。随后提出一种联合训练策略,以应对网络监督学习中多数据源与多格式之间的领域差异。联合训练中采用了数据平衡、重采样和跨数据集 mixup 等若干良好实践。实验表明,通过利用多源多格式数据,OmniSource 在训练中更具数据效率。仅使用从互联网爬取且无人工标注的 3.5M 图像和 800K 分钟视频(少于先前工作的 2%),我们的 OmniSource 模型在 Kinetics-400 基准上分别将 2D 和 3D-ConvNet 基线模型的 Top-1 准确率提升了 3.0% 和 3.9%。借助 OmniSource,我们以不同预训练策略为视频识别建立了新纪录。我们的最佳模型在 Kinetics-400 基准上分别针对从头训练、ImageNet 预训练和 IG-65M 预训练取得了 80.4%、80.5% 和 83.6 的 Top-1 准确率。
引用
@article{arxiv.2003.13042,
title = {Omni-sourced Webly-supervised Learning for Video Recognition},
author = {Haodong Duan and Yue Zhao and Yuanjun Xiong and Wentao Liu and Dahua Lin},
journal= {arXiv preprint arXiv:2003.13042},
year = {2020}
}