中文

面向多语种说话人识别的解耦表示学习

音频与语音处理 2023-06-08 v3 声音

摘要

本文的目标是学习适用于双语说话场景的鲁棒说话人表示。世界上大多数人至少说两种语言;然而,大多数说话人识别系统在同一说话人使用不同语言说话时无法识别。流行的说话人识别评测集未考虑双语场景,使得分析双语说话人对识别性能的影响十分困难。本文发布了一个由 VoxCeleb 衍生、考虑双语场景的大规模评测集 VoxCeleb1-B。我们引入了一种结合对抗学习与基于度量学习方法的有效的 disentanglement 学习策略。该方法通过将语言相关信息从说话人表示中解耦,同时确保说话人表示的稳定学习,来解决双语情形。我们的语言解耦学习方法仅使用语言伪标签,无需人工信息。

关键词

引用

@article{arxiv.2211.00437,
  title  = {Disentangled representation learning for multilingual speaker recognition},
  author = {Kihyun Nam and Youkyum Kim and Jaesung Huh and Hee Soo Heo and Jee-weon Jung and Joon Son Chung},
  journal= {arXiv preprint arXiv:2211.00437},
  year   = {2023}
}

备注

Interspeech 2023