通过 Wav2vec 微调实现低资源语言的说话人分割
声音
2025-04-29 v1 计算与语言
音频与语音处理
摘要
说话人分割是语音处理中的基础任务,涉及将音频流按说话人划分。尽管基于高资源语言的前沿模型已取得进展,但诸如 Kurdish(叙利亚语)等低资源语言面临数据有限、方言多样且频繁代码切换等独特挑战。本研究通过在专门的 Kurdish 语料库上训练 Wav2Vec 2.0 自监督学习模型来应对这些问题。利用迁移学习,我们将来自其他语言所学的多语言表示迁移到 Kurdish 语音的声学和语音特征捕获。相对于基线方法,我们的方法将分割错误率降低了7.2个百分点,将聚类纯度提高了13个百分点。这些发现表明,针对资源不足的语言增强现有模型可显著改善分割性能。我们的工作在为 Kurdish 语言媒体开发转录服务、以及在多语言呼叫中心、会议和视频会议系统中进行说话人分割方面具有实际意义。这些结果为在其他缺乏研究的语言中构建有效的分割系统奠定了基础,推动了语音技术的公平性。
引用
@article{arxiv.2504.18582,
title = {Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning},
author = {Abdulhady Abas Abdullah and Sarkhel H. Taher Karim and Sara Azad Ahmed and Kanar R. Tariq and Tarik A. Rashid},
journal= {arXiv preprint arXiv:2504.18582},
year = {2025}
}