中文

通过合成说话人提高目标说话人提取的课程学习

声音 2024-10-08 v2 音频与语音处理

摘要

目标说话人提取(TSE)旨在从复杂的语音环境中隔离出单个说话人的声音。TSE系统的效果往往会因说话人特征彼此相似而受到影响。近期研究引入了课程学习(CL),即对TSE模型逐渐在语音样本的复杂度上进行训练。在CL训练中,模型首先在目标说话人与干扰说话人之间的说话人相似性较低的样本上训练,然后在相似性较高的样本上训练。为进一步提高CL效果,本文使用基于k近邻的语音转换方法来模拟和生成多样化的干扰说话人,然后将生成的数据作为CL的一部分。实验表明,基于合成说话人的训练数据能够有效提升模型能力,显著改善多个TSE系统的性能。

关键词

引用

@article{arxiv.2410.00811,
  title  = {Improving curriculum learning for target speaker extraction with synthetic speakers},
  author = {Yun Liu and Xuechen Liu and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2410.00811},
  year   = {2024}
}

备注

Accepted by SLT2024