见声与闻声:利用跨模态自监督学习判别性嵌入
声音
2020-11-05 v2 计算机视觉与模式识别
音频与语音处理
摘要
本工作的目标是在无人工标注数据的情况下训练判别性跨模态嵌入。自监督学习的最新进展表明,可从自然的跨模态同步中学习到有效表示。我们在早期工作基础上训练对单模态下游任务更具判别性的嵌入。为此,我们提出一种新颖训练策略,不仅优化跨模态度量,还强化各模态内的类内特征分离。该方法的有效性在两个下游任务上得到验证:利用音频-视觉同步训练特征进行唇读,以及利用为跨模态生物特征匹配训练的特征进行说话人识别。所提方法以显著优势优于最先进的自监督基线。
引用
@article{arxiv.2004.14326,
title = {Seeing voices and hearing voices: learning discriminative embeddings using cross-modal self-supervision},
author = {Soo-Whan Chung and Hong Goo Kang and Joon Son Chung},
journal= {arXiv preprint arXiv:2004.14326},
year = {2020}
}
备注
Under submission as a conference paper