中文

见声与闻声:利用跨模态自监督学习判别性嵌入

声音 2020-11-05 v2 计算机视觉与模式识别 音频与语音处理

摘要

本工作的目标是在无人工标注数据的情况下训练判别性跨模态嵌入。自监督学习的最新进展表明,可从自然的跨模态同步中学习到有效表示。我们在早期工作基础上训练对单模态下游任务更具判别性的嵌入。为此,我们提出一种新颖训练策略,不仅优化跨模态度量,还强化各模态内的类内特征分离。该方法的有效性在两个下游任务上得到验证:利用音频-视觉同步训练特征进行唇读,以及利用为跨模态生物特征匹配训练的特征进行说话人识别。所提方法以显著优势优于最先进的自监督基线。

关键词

引用

@article{arxiv.2004.14326,
  title  = {Seeing voices and hearing voices: learning discriminative embeddings using cross-modal self-supervision},
  author = {Soo-Whan Chung and Hong Goo Kang and Joon Son Chung},
  journal= {arXiv preprint arXiv:2004.14326},
  year   = {2020}
}

备注

Under submission as a conference paper