中文

面向多语言电话调用的无监督说话人分割系统:基于预训练 Whisper 模型和稀疏自编码器混合模型

音频与语音处理 2024-09-13 v3

摘要

现有的说话人分割系统通常依赖大量的人工标注数据,这在实际场景中既费时又难以获取。此外,这些系统语言特定的限制显著削弱了其在多语言环境下的效果和可扩展性。本文提出了一种面向多语言电话调用应用的基于聚类的说话人分割系统。我们 proposed 的系统支持多种语言,在训练时无需大规模标注数据,即可通过利用多语言 Whisper 模型提取说话人嵌入。此外,我们引入了一种名为混合稀疏自编码器 (Mix-SAE) 的网络架构,用于无监督说话人聚类。实验结果表明,在源自 CALLHOME 和 CALLFRIEND 电话语料库中两说话人子集的评估数据集上,所提出的 Mix-SAE 网络在其他基于自编码器的聚类方法中表现优异。我们 proposed 的系统整体性能也凸显了在标注数据有限的背景下发展无监督、多语言说话人分割系统的前景。该系统在基于通用模型(如结合语音识别、语言检测和说话人分割)的多任务语音分析应用中的集成能力也同样突出。

关键词

引用

@article{arxiv.2407.01963,
  title  = {Towards Unsupervised Speaker Diarization System for Multilingual Telephone Calls Using Pre-trained Whisper Model and Mixture of Sparse Autoencoders},
  author = {Phat Lam and Lam Pham and Truong Nguyen and Dat Ngo and Thinh Pham and Tin Nguyen and Loi Khanh Nguyen and Alexander Schindler},
  journal= {arXiv preprint arXiv:2407.01963},
  year   = {2024}
}

备注

Preprint, 14 pages, 6 figures