中文

完美匹配:改进音视频同步的跨模态嵌入

计算机视觉与模式识别 2020-11-05 v2 声音 音频与语音处理

摘要

本文提出了一种用于学习音视频同步的强大跨模态嵌入的新策略。我们将该问题设定为跨模态检索问题,其目标是给定一段短视频片段,找到最相关的音频段。该方法建立在跨模态自监督表示学习的最新进展之上。本文的主要贡献如下:(1)我们提出了一种新的学习策略,其中嵌入是通过多路匹配问题学习的,而非近期论文所提出的二分类(匹配或不匹配)问题;(2)我们证明了该方法在同步任务上的性能远超现有基线;(3)我们将学到的嵌入用于自监督下的视觉语音识别,并表明其性能与以全监督方式端到端学习的表示相当。

关键词

引用

@article{arxiv.1809.08001,
  title  = {Perfect match: Improved cross-modal embeddings for audio-visual synchronisation},
  author = {Soo-Whan Chung and Joon Son Chung and Hong-Goo Kang},
  journal= {arXiv preprint arXiv:1809.08001},
  year   = {2020}
}

备注

Preprint. Work in progress