解耦神经说话人表示中编码信息的实证分析
音频与语音处理
2020-04-09 v2 声音
摘要
鲁棒说话人表示的主要特征是它们对与说话人身份无关的变化因素保持不变。说话人表示的解耦是用于提升说话人表示对内在因素(在语音产生过程中获得,如情感、词汇内容)和外在因素(在信号捕获过程中获得,如信道、噪声)鲁棒性的技术之一。神经说话人表示中的解耦可以通过对有干扰因素(与说话人身份无关的因素)标注的监督方式实现,也可以在不需去除因素标签的无监督方式下实现。无论哪种情况,理解各种变化因素在表示中的纠缠程度都很重要。本工作中,我们考察了有和无无监督解耦的说话人表示,以了解它们捕获的与一系列因素相关的信息量。利用分类实验,我们提供了经验证据:解耦减少了说话人表示中关于干扰因素的信息,同时保留了说话人信息。这通过在 VOiCES 语料库上多种挑战性声学条件下的说话人验证实验得到进一步验证。我们还展示了在解耦说话人嵌入训练中使用数据增强可提升说话人验证任务的鲁棒性。最后,基于我们的发现,我们深入分析了可利用无监督解耦技术有效分离的因素,并讨论了潜在的未来方向。
引用
@article{arxiv.2002.03520,
title = {An empirical analysis of information encoded in disentangled neural speaker representations},
author = {Raghuveer Peri and Haoqi Li and Krishna Somandepalli and Arindam Jati and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2002.03520},
year = {2020}
}
备注
Submitted to Speaker Odyssey 2020