中文

利用多模态自监督从零标注无标签视频

计算机视觉与模式识别 2021-03-02 v3 机器学习

摘要

当前深度学习取得的巨大成功在很大程度上归功于数据的有效性——更确切地说:是带标签的数据。然而,通过人工标注来标注数据集仍然成本高昂,尤其是针对视频。虽然在图像领域,近期的方法已能够在无监督情况下为无标签数据集生成有意义的(伪)标签,但视频领域尚缺乏此类进展,其当前研究焦点仍在于学习特征表示。在本工作中,我们 a) 表明视频数据集的无监督标注并非强特征编码器自然附带的结果,b) 提出了一种新颖的聚类方法,通过利用音频与视觉模态之间的自然对应关系,无需任何人工标注即可对视频数据集进行伪标注。大量分析表明,所得聚类与真实人工标签具有高度的语义重叠。我们进一步给出了在 Kinetics、Kinetics-Sound、VGG-Sound 和 AVE 等常用视频数据集上无监督标注的首批基准测试结果。

关键词

引用

@article{arxiv.2006.13662,
  title  = {Labelling unlabelled videos from scratch with multi-modal self-supervision},
  author = {Yuki M. Asano and Mandela Patrick and Christian Rupprecht and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2006.13662},
  year   = {2021}
}

备注

Accepted to NeurIPS 2020. Project page: https://www.robots.ox.ac.uk/~vgg/research/selavi, code: https://github.com/facebookresearch/selavi