中文

推进端到端语音分离的极限

声音 2025-09-19 v1

摘要

本文在多个公开数据集上给出了最先进的语音分离错误率(DER),包括 AliMeeting-far、AliMeeting-near、AMI-Mix、AMI-SDM、DIHARD III 和 MagicData RAMC。基于 EEND-TA——一种用于端到端说话人分离的统一非自回归模型——我们在 DIHARD III 上取得了 14.49% 的 DER 等新的基准结果。我们的方法通过 8 说话人模拟混合进行预训练扩展,确保每个生成的说话人混合配置都得到充分表示。这些实验表明,基于 EEND 的架构具有比先前探索更大的学习能力,超越了许多现有的分离方案,同时在推理过程中保持高效的速度。

关键词

引用

@article{arxiv.2509.14737,
  title  = {Pushing the Limits of End-to-End Diarization},
  author = {Samuel J. Broughton and Lahiru Samarakoon},
  journal= {arXiv preprint arXiv:2509.14737},
  year   = {2025}
}

备注

As presented at Interspeech 2025