中文

基于模型无关元学习的域不变说话人向量投影

音频与语音处理 2020-05-26 v1

摘要

即使采用基于深度神经网络的 SOTA 架构,域泛化仍是说话人识别中的关键问题。例如,在朗读语音上训练的模型应用于唱歌或电影场景时可能大幅失效。在本文中,我们提出一种域不变投影以提升说话人向量的泛化能力。该投影是一个简单的神经网络,遵循 Model-Agnostic Meta-Learning (MAML) 原则进行训练,其目标是在用另一域的语音数据更新后,仍能对该域中的说话人进行分类。我们在 CNCeleb 上测试了所提方法,这是一个由单说话人多条件 (SSMC) 数据构成的新数据集。结果表明,基于 MAML 的域不变投影能产生更具泛化能力的说话人向量,并有效提升在未见域上的性能。

关键词

引用

@article{arxiv.2005.11900,
  title  = {Domain-Invariant Speaker Vector Projection by Model-Agnostic Meta-Learning},
  author = {Jiawen Kang and Ruiqi Liu and Lantian Li and Yunqi Cai and Dong Wang and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:2005.11900},
  year   = {2020}
}

备注

submitted to INTERSPEECH 2020