利用互学习说话人表示
音频与语音处理
2019-04-09 v2 计算与语言
机器学习
神经与进化计算
声音
摘要
在深度学习中,学习良好的表示至关重要。互信息(MI)或类似的统计依赖度量是以无监督方式学习这些表示的有前景的工具。尽管在高维空间中直接度量两个随机变量的互信息较为困难,但近期一些研究表明,可借助类似于生成对抗网络(GANs)的编码器-判别器架构隐式优化MI。本工作中,我们通过最大化从同一句子中随机采样的语音块编码表示之间的互信息,来学习捕捉说话人身份的表示。所提编码器基于SincNet架构,将原始语音波形转换为紧凑特征向量。判别器输入正样本(编码块联合分布的样本)或负样本(边缘分布乘积的样本),并被训练以区分二者。我们报告的实验表明,该方法能有效学习有用的说话人表示,在说话人识别与验证任务上取得有前景的结果。我们的实验考虑了无监督与半监督设定,并比较了不同目标函数所取得的性能。
引用
@article{arxiv.1812.00271,
title = {Learning Speaker Representations with Mutual Information},
author = {Mirco Ravanelli and Yoshua Bengio},
journal= {arXiv preprint arXiv:1812.00271},
year = {2019}
}
备注
Submitted to Interspeech 2019