基于课程学习的目标说话人提取
音频与语音处理
2024-06-13 v1 声音
摘要
本文提出了一种 novel 方法,用于采用课程学习(Curriculum Learning, CL)技术进行目标说话人提取(Target Speaker Extraction, TSE),以解决在包含干扰说话人语音的混合信号中区分目标说话人语音的挑战。为实现高效训练,本文提出设计一种课程,以选择递增复杂度的子集,例如增加目标说话人与干扰说话人的相似度,并策略性地选择训练数据。我们的课程学习策略包括两种变体:一种是使用预定义的难度度量(如性别、说话人相似度和信噪比);另一种是使用 TSE 的标准目标函数,旨在逐步暴露模型于更具挑战性的情境。在 Libri2talker 数据集上进行的全面测试表明,我们的课程学习策略在 TSE 中提升了性能,且结果在没有课程学习的基线模型之上约提升了 1 dB。
引用
@article{arxiv.2406.07845,
title = {Target Speaker Extraction with Curriculum Learning},
author = {Yun Liu and Xuechen Liu and Xiaoxiao Miao and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2406.07845},
year = {2024}
}
备注
Accepted for presentation at Interspeech 2024