基于模型无关元学习的域不变说话人向量投影
音频与语音处理
2020-05-26 v1
摘要
即使采用基于深度神经网络的 SOTA 架构,域泛化仍是说话人识别中的关键问题。例如,在朗读语音上训练的模型应用于唱歌或电影场景时可能大幅失效。在本文中,我们提出一种域不变投影以提升说话人向量的泛化能力。该投影是一个简单的神经网络,遵循 Model-Agnostic Meta-Learning (MAML) 原则进行训练,其目标是在用另一域的语音数据更新后,仍能对该域中的说话人进行分类。我们在 CNCeleb 上测试了所提方法,这是一个由单说话人多条件 (SSMC) 数据构成的新数据集。结果表明,基于 MAML 的域不变投影能产生更具泛化能力的说话人向量,并有效提升在未见域上的性能。
引用
@article{arxiv.2005.11900,
title = {Domain-Invariant Speaker Vector Projection by Model-Agnostic Meta-Learning},
author = {Jiawen Kang and Ruiqi Liu and Lantian Li and Yunqi Cai and Dong Wang and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:2005.11900},
year = {2020}
}
备注
submitted to INTERSPEECH 2020