探索基于混合专家的说话人分割
声音
2025-06-18 v1 人工智能
摘要
本文提出了一种新型神经说话人分割系统,使用基于记忆感知的多说话人嵌入和序列到序列架构(NSD-MS2S),该系统将记忆感知的多说话人嵌入模块与序列到序列架构相结合。该系统利用记忆模块来增强说话人嵌入,并采用Seq2Seq框架高效地将声学特征映射到说话人标签。此外,我们探索了在说话人分割中应用混合专家的方法,提出了一种共享和软混合专家(SS-MoE)模块进一步缓解模型偏差并提升性能。将SS-MoE纳入后,模型扩展为NSD-MS2S-SSMoE。在多个复杂声学数据集上进行实验,包括CHiME-6、DiPCo、Mixer 6和DIHARD-III评估集,结果显示在鲁棒性和泛化性方面均取得有意义的改进。所提出的方法实现了最新的成果,展示了其在挑战性真实场景中的有效性。
引用
@article{arxiv.2506.14750,
title = {Exploring Speaker Diarization with Mixture of Experts},
author = {Gaobin Yang and Maokui He and Shutong Niu and Ruoyu Wang and Hang Chen and Jun Du},
journal= {arXiv preprint arXiv:2506.14750},
year = {2025}
}