中文

量化并减少 Common Voice 语料库内用于语音分析的说话人异质性

音频与语音处理 2025-06-03 v1 声音

摘要

凭借其跨语言和跨说话人的多样性,Mozilla Common Voice 语料库(CV)一直是多语言语音技术的宝贵资源,并在跨语言语音学和语音科学研究中具有巨大潜力。然而,正确考量说话人变异是语音研究理论与统计基础的关键。尽管 CV 提供了客户端 ID 作为说话人 ID 的近似,但多个说话人可能会在同一个 ID 下贡献录音。本研究旨在量化并减少客户端 ID 内的异质性,以更好地近似真实且仍保持匿名的说话人 ID。使用基于 ResNet 的声纹嵌入,我们获得了同一客户端 ID 下录音之间的相似度得分,随后实现了说话人判别任务,以确定减少感知到的说话人异质性的最佳阈值。这些结果对语音分析及基于说话人的语音技术发展具有重要下游应用。

关键词

引用

@article{arxiv.2506.00733,
  title  = {Quantifying and Reducing Speaker Heterogeneity within the Common Voice Corpus for Phonetic Analysis},
  author = {Miao Zhang and Aref Farhadipour and Annie Baker and Jiachen Ma and Bogdan Pricop and Eleanor Chodroff},
  journal= {arXiv preprint arXiv:2506.00733},
  year   = {2025}
}

备注

Accepted for Interspeech 2025