基于端到端对抗语言自适应的说话人验证
音频与语音处理
2018-11-07 v1 声音
摘要
本文研究了利用对抗域自适应来解决说话人识别语料库之间语言不匹配的问题。在说话人验证的背景下,对抗域自适应方法旨在最小化当从源域和目标域(即语言)抽取时,语句级特征(即说话人嵌入)所服从分布之间的某些散度,同时保持其识别说话人的能力。用于提取语句级表示的神经架构使我们能够以端到端方式应用对抗自适应方法,并与标准交叉熵损失联合训练网络。我们考察了多种配置,例如在目标域上使用(伪)标签以及特征提取器中的域标签,并在具有挑战性的 NIST SRE16 和 SRE18 基准上证明了我们方法的有效性。
引用
@article{arxiv.1811.02331,
title = {Speaker verification using end-to-end adversarial language adaptation},
author = {Johan Rohdin and Themos Stafylakis and Anna Silnova and Hossein Zeinali and Lukas Burget and Oldrich Plchot},
journal= {arXiv preprint arXiv:1811.02331},
year = {2018}
}