中文

利用多阶段训练与课程学习改进混响语音分离

音频与语音处理 2021-07-21 v1 声音

摘要

我们提出了一种改进混响语音分离性能的新方法。我们的方法基于一个精确的几何声学模拟器(GAS),该模拟器通过建模镜面反射与漫反射生成逼真的房间脉冲响应(RIRs)。我们还提出了三种训练方法——预训练、多阶段训练和课程学习,它们在混响存在时显著提升了分离质量。我们还证明,在训练时将合成 RIRs 与少量真实 RIRs 混合可增强分离性能。我们在 VOiCES 数据集的真实录制数据(多种不同房间配置)生成的混响混合信号上评估了我们的方法。我们的新方法(课程学习+预训练+多阶段训练)相比基于镜像源方法(ISM)的先前技术取得了显著的相对改进。

关键词

引用

@article{arxiv.2107.09177,
  title  = {Improving Reverberant Speech Separation with Multi-stage Training and Curriculum Learning},
  author = {Rohith Aralikatti and Anton Ratnarajah and Zhenyu Tang and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2107.09177},
  year   = {2021}
}