中文

利用 AV-HuBERT 学习基于唇部的音视觉说话人嵌入

音频与语音处理 2022-07-18 v2 计算机视觉与模式识别 声音

摘要

本文研究用于音视觉说话人表征学习的自监督预训练,其中展示说话人嘴部区域的视觉流与语音一同作为输入。我们的研究聚焦于音视觉隐单元 BERT(AV-HuBERT)方法,这是一种近期开发的通用音视觉语音预训练框架。我们进行了大量实验以探究预训练与视觉模态的有效性。实验结果表明,AV-HuBERT 能较好地泛化至说话人相关下游任务,使纯音频与音视觉说话人验证的标签效率均提升约十倍。我们还表明,即便仅融入视觉信息(仅唇部区域),也能大幅改善性能与噪声鲁棒性,在干净条件下将等错误率(EER)降低 38%,在噪声条件下降低 75%。

关键词

引用

@article{arxiv.2205.07180,
  title  = {Learning Lip-Based Audio-Visual Speaker Embeddings with AV-HuBERT},
  author = {Bowen Shi and Abdelrahman Mohamed and Wei-Ning Hsu},
  journal= {arXiv preprint arXiv:2205.07180},
  year   = {2022}
}

备注

Interspeech 2022