中文

桥接语言鸿沟:通过潜在混合提升合成语音多样性以实现平等语音识别

计算与语言 2025-11-26 v1

摘要

现代机器学习模型在音频任务上通常在英语及其他资源丰富的语言上表现优异,主要due于可用训练数据的丰富。这一差异导致低资源语言上的性能不公平差,数据收集在此类语言上既困难又昂贵。本文介绍了一种新的数据增强技术,用于语音语料库,以缓解这一差距。通过大量实验,我们展示了该方法显著提高了自动语音识别系统在低资源语言上的性能。 Furthermore, 我们显示该方法优于现有的增强策略,为提升边缘语言社区中的语音技术提供了实用解决方案。

关键词

引用

@article{arxiv.2511.20534,
  title  = {Bridging the Language Gap: Synthetic Voice Diversity via Latent Mixup for Equitable Speech Recognition},
  author = {Wesley Bian and Xiaofeng Lin and Guang Cheng},
  journal= {arXiv preprint arXiv:2511.20534},
  year   = {2025}
}

备注

Accepted at ICML 2025 Workshop on Machine Learning for Audio