基于一次学习(one shot learning)的多口音语音分离
声音
2021-08-06 v3 音频与语音处理
摘要
语音分离是语音处理领域中近期被充分研究的一个问题。然而,研究多口音语音分离场景的工作并不多。具有新口音和噪声的未见过说话人引发了域失配问题,这是传统联合训练方法难以解决的。因此,我们应用 MAML 和 FOMAML 来解决此问题,并在几乎所有未见过口音上获得了比联合训练更高的平均 Si-SNRi 值。这证明了这两种方法确实具备生成训练良好参数的能力,以适应新说话人和新口音的语音混合。此外,我们发现 FOMAML 取得了与 MAML 相近的性能,同时节省了大量时间。
引用
@article{arxiv.2106.11713,
title = {Multi-accent Speech Separation with One Shot Learning},
author = {Kuan-Po Huang and Yuan-Kuei Wu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2106.11713},
year = {2021}
}
备注
Accepted at ACL 2021 Meta Learning for NLP