中文

面向目标说话人提取的训练动力学感知的多因素课程学习

声音 2026-03-06 v1

摘要

目标说话人提取 (TSE) 旨在从多说话人混合信号中隔离特定说话人的声音。尽管在基准测试上取得了优异的成绩,但实际应用中性能常因不同相互作用因素而下降。以往针对 TSE 的课程学习方法通常分别处理这些因素,无法捕捉其复杂相互作用,且依赖预定义的难度因素可能与实际模型学习行为不符。为此,我们首先提出一种多因素课程学习策略,联合调度信噪比阈值、说话人数量、重叠比例以及合成/真实比例,实现从简单到复杂情景的渐进式学习。然而,确定最优调度而不依赖预设假设仍具挑战。我们因此引入 TSE-Datamap,一个基于观察训练动力学的可视化框架,通过跟踪训练各阶段的置信度与波动性来指导课程设计。我们的分析揭示了三类特征数据区域:(i) 易学习样本——模型始终表现良好;(ii) 模糊样本——模型在备选预测之间摇摆;(iii) 难学习样本——模型持续难以学习。基于这些数据驱动的洞见,我们的方法相对于随机采样显著提升提取效果,在具备挑战性的多说话人场景中尤其取得显著 gains。

关键词

引用

@article{arxiv.2603.04943,
  title  = {Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker Extraction},
  author = {Yun Liu and Xuechen Liu and Xiaoxiao Miao and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2603.04943},
  year   = {2026}
}