推进端到端语音分离的极限
声音
2025-09-19 v1
摘要
本文在多个公开数据集上给出了最先进的语音分离错误率(DER),包括 AliMeeting-far、AliMeeting-near、AMI-Mix、AMI-SDM、DIHARD III 和 MagicData RAMC。基于 EEND-TA——一种用于端到端说话人分离的统一非自回归模型——我们在 DIHARD III 上取得了 14.49% 的 DER 等新的基准结果。我们的方法通过 8 说话人模拟混合进行预训练扩展,确保每个生成的说话人混合配置都得到充分表示。这些实验表明,基于 EEND 的架构具有比先前探索更大的学习能力,超越了许多现有的分离方案,同时在推理过程中保持高效的速度。
引用
@article{arxiv.2509.14737,
title = {Pushing the Limits of End-to-End Diarization},
author = {Samuel J. Broughton and Lahiru Samarakoon},
journal= {arXiv preprint arXiv:2509.14737},
year = {2025}
}
备注
As presented at Interspeech 2025