中文

面向音视觉语音分离的多模态多相关性学习

声音 2022-07-05 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

本文提出一种面向音视觉语音分离任务的多模态多相关性学习框架。尽管以往工作已广泛致力于融合音频与视觉模态,但多数仅采用音频与视觉特征的简单拼接。为挖掘这两种模态背后真正有用的信息,我们定义了两个关键相关性:(1)身份相关性(音色与面部属性之间);(2)语音相关性(音素与唇部运动之间)。这两种相关性共同构成完整信息,在一些困难情形(如同性别或相似内容)下展现出分离目标说话人声音的特定优势。在实现上,采用对比学习或对抗训练方法来最大化这两种相关性。二者均表现良好,而对抗训练通过避免对比学习的某些局限展现出其优势。与以往研究相比,我们的方案在实验指标上取得明显提升且无额外复杂度。进一步分析揭示了所提架构的有效性及其良好的未来扩展潜力。

关键词

引用

@article{arxiv.2207.01197,
  title  = {Multi-Modal Multi-Correlation Learning for Audio-Visual Speech Separation},
  author = {Xiaoyu Wang and Xiangyu Kong and Xiulian Peng and Yan Lu},
  journal= {arXiv preprint arXiv:2207.01197},
  year   = {2022}
}

备注

5 pages, accepted by interspeech2022