无嵌入的长篇神经说话人分割方法
音频与语音处理
2024-06-28 v1 人工智能
计算与语言
机器学习
摘要
端到端神经说话人分割 (EEND) 模型相较于传统基于嵌入的说话人分割方法取得了显著改进,但在面对大量说话人时的长音频泛化能力仍不足。EEND-vector-clustering 方法通过结合局部 EEND 与来自局部窗口的说话人嵌入的全局聚类来缓解这一问题,但需要额外的说话人嵌入框架配合 EEND 模块。本文提出了一种新框架,无需独立的说话人嵌入,即可对长音频在局部和全局范围内应用 EEND。该方法在 Callhome American English 和 RT03-CTS 数据集上相较于传统单次 EEND 达到了 13% 和 10% 的显著相对 DER 降低,相较于 EEND-vector-clustering 也仅有细微的改进,且无需额外的说话人嵌入。此外,我们讨论了本文提出框架的计算复杂度,并探索了降低处理时间的策略。
引用
@article{arxiv.2406.18679,
title = {Speakers Unembedded: Embedding-free Approach to Long-form Neural Diarization},
author = {Xiang Li and Vivek Govindan and Rohit Paturi and Sundararajan Srinivasan},
journal= {arXiv preprint arXiv:2406.18679},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024