结合TDOA-based分段与说话人嵌入-based聚类的会议空间-频谱说话人分割
音频与语音处理
2025-09-01 v2 声音
摘要
我们提出了一种由TDOA-based分段后接合说话人嵌入-based聚类的空间-频谱组合模型基于和数据驱动的说话人分割管道。该提议系统既不需要访问多通道训练数据,也不需要关于麦克风数量或布置的先验知识。它适用于紧凑型麦克风阵列和分布式麦克风,仅需_minor adjustments_。由于其在分段阶段对重叠语音的处理优势,提议管道在紧凑型麦克风阵列场景和分布式麦克风 setup中均显著优于单通道pyannote方法。此外,我们表明,与完全空间说话人分割管道不同,提议系统可以在说话人更换位置时正确跟踪说话人。
引用
@article{arxiv.2506.16228,
title = {Spatio-spectral diarization of meetings by combining TDOA-based segmentation and speaker embedding-based clustering},
author = {Tobias Cord-Landwehr and Tobias Gburrek and Marc Deegen and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2506.16228},
year = {2025}
}
备注
Proceedings of INTERSPEECH