中文

NoisyActions2M:用于带噪标签视频理解的多媒体数据集

多媒体 2021-10-14 v1 计算机视觉与模式识别 机器学习

摘要

深度学习在广泛问题中取得了显著进展。然而,此类模型的高效训练需要大规模数据集,而为这类数据集获取标注既具挑战又成本高昂。本工作中,我们探索利用网络视频中用户生成的免费可用标签进行视频理解。我们创建了一个基准数据集,包含约200万段视频及相关的用户生成标注与其他元信息。我们利用所收集的数据集进行动作分类,并借助现有的小规模标注数据集UCF101与HMDB51展示其效用。我们研究了不同的损失函数与两种预训练策略——简单预训练与自监督学习。我们还展示了在所提数据集上预训练的网络如何帮助抵御下游数据集中的视频损坏与标签噪声。我们将此作为视频理解中噪声学习的基准数据集呈现。该数据集、代码与训练模型将公开供未来研究使用。

关键词

引用

@article{arxiv.2110.06827,
  title  = {NoisyActions2M: A Multimedia Dataset for Video Understanding from Noisy Labels},
  author = {Mohit Sharma and Raj Patra and Harshal Desai and Shruti Vyas and Yogesh Rawat and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2110.06827},
  year   = {2021}
}

备注

Accepted at ACM Multimedia Asia 2021