中文

通过联合音视觉自监督从原始音频中学习语音表示

音频与语音处理 2020-07-14 v1 计算与语言 计算机视觉与模式识别 机器学习 多媒体 声音

摘要

音频与视觉模态之间的直观交互对于跨模态自监督学习很有价值。这一概念已在视频动作识别和声学场景分类等通用音视觉任务中得到证明。然而,自监督在音视觉语音中仍未被充分探索。我们提出了一种从原始音频波形中学习自监督语音表示的方法。我们训练原始音频编码器,将仅音频自监督(通过预测信息性音频属性)与视觉自监督(通过从音频生成说话人脸)相结合。视觉代理任务驱动音频表示捕获与唇部运动相关的信息。这用视觉信息丰富了音频编码器,且该编码器无需视觉模态即可用于评估。我们的方法在已建立的孤立词分类基准上取得了与现有自监督音频特征相当的竞争性能,并且在少标签学习方面显著优于其他方法。值得注意的是,我们的方法也优于全监督训练,从而为语音相关任务提供了强大的初始化。我们的结果展示了多模态自监督在音视觉语音中学习良好音频表示的潜力。

关键词

引用

@article{arxiv.2007.04134,
  title  = {Learning Speech Representations from Raw Audio by Joint Audiovisual Self-Supervision},
  author = {Abhinav Shukla and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2007.04134},
  year   = {2020}
}

备注

Accepted at the Workshop on Self-supervision in Audio and Speech at ICML 2020