中文

看,听与学

计算机视觉与模式识别 2017-08-02 v2 机器学习

摘要

我们考虑这样一个问题:通过观看和收听大量未标记的视频可以学到什么?视频本身包含一种有价值但迄今尚未被利用的信息来源——视觉流与音频流之间的对应关系,我们引入了一种利用该信息的全新“视听对应”学习任务。我们展示了在没有任何额外监督(仅使用原始无约束视频本身)的情况下,从头训练视觉和音频网络能够成功解决此任务,并且更有趣的是,能产生良好的视觉和音频表示。这些特征在两个声音分类基准上创下了新的 SOTA,并在 ImageNet 分类上与 SOTA 自监督方法表现相当。我们还证明了该网络能够在两种模态中定位物体,以及执行细粒度识别任务。

关键词

引用

@article{arxiv.1705.08168,
  title  = {Look, Listen and Learn},
  author = {Relja Arandjelović and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1705.08168},
  year   = {2017}
}

备注

Appears in: IEEE International Conference on Computer Vision (ICCV) 2017