中文

面向文本无关说话人验证的跨模态音视频协同学习

声音 2023-02-23 v1 计算机视觉与模式识别 机器学习 音频与语音处理 图像与视频处理

摘要

视觉语音(即唇部运动)由于语音产生过程中的共现与同步,与听觉语音高度相关。本文研究这一相关性并提出一种跨模态语音协同学习范式。我们跨模态协同学习方法的主要动机是利用另一模态的知识辅助建模某一模态。具体而言,基于音视频伪孪生结构引入两个跨模态增强器以学习模态变换后的相关性。在每个增强器内部,提出一种嵌入最大特征图的 Transformer 变体用于模态对齐与增强特征生成。该网络同时从零开始以及与预训练模型协同学习。在 LRSLip3、GridLip、LomGridLip 和 VoxLip 数据集上的实验结果表明,我们提出的方法相比独立训练的纯音频/纯视觉系统以及基线融合系统,分别实现了平均 60% 和 20% 的相对性能提升。

关键词

引用

@article{arxiv.2302.11254,
  title  = {Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification},
  author = {Meng Liu and Kong Aik Lee and Longbiao Wang and Hanyi Zhang and Chang Zeng and Jianwu Dang},
  journal= {arXiv preprint arXiv:2302.11254},
  year   = {2023}
}