面向视频动作识别的大规模弱监督预训练
计算机视觉与模式识别
2019-05-03 v1
摘要
当前全监督视频数据集仅包含数十万视频和不到一千个特定领域标签。这阻碍了先进视频架构的进展。本文对使用大量网络视频预训练视频模型以用于动作识别任务进行了深入研究。我们的主要经验发现是,在非常大尺度(超过6500万视频)上预训练,尽管基于带噪声的社交媒体视频与标签,仍大幅提升了三个具挑战性的公开动作识别数据集上的最优性能。此外,我们考察了弱监督视频动作数据集构建中的三个问题。第一,鉴于动作涉及与物体的交互,应如何构建动宾预训练标签空间以最大程度有益于迁移学习?第二,基于帧的模型在动作识别上表现相当好;为良好图像特征预训练是否足够,还是为时空特征预训练对最优迁移学习有价值?最后,相较于短视频,长视频中动作通常定位较差;由于动作标签在视频级别给出,在视频数量或时长的固定预算下,应如何选择视频片段以获得最佳性能?
引用
@article{arxiv.1905.00561,
title = {Large-scale weakly-supervised pre-training for video action recognition},
author = {Deepti Ghadiyaram and Matt Feiszli and Du Tran and Xueting Yan and Heng Wang and Dhruv Mahajan},
journal= {arXiv preprint arXiv:1905.00561},
year = {2019}
}