自监督语音表示仍在非裔美国英语中存在困境
计算与语言
2024-08-27 v1 声音
音频与语音处理
摘要
ASR 系统对非裔美国英语 (AAVE) 说话者及其他被边缘化语言变体的表现不佳是众所周知的现象,这进一步加剧了这些语言变体的污名化。我们研究最近一波自监督学习 (SSL) 语音模型是否能够在 AAVE 和主流美国英语 (MAE) 之间的 ASR 性能差距方面取得突破。我们对四个 SSL 模型 (wav2vec 2.0、HuBERT、WavLM 和 XLS-R) 在零样本自动语音识别 (ASR) 中对这两种语言变体进行评估,发现这些模型延续了对 AAVE 表现不佳的偏见。此外,这些模型在包含更多 AAVE 语音和形态句法特征的说话中,具有更高的词错误率。尽管 SSL 语音模型在改善低资源语言变体的 ASR 方面取得了成功,但仅靠 SSL 预训练可能无法弥合 AAVE 和 MAE 之间的差距。我们的代码已公开于 https://github.com/cmu-llab/s3m-aave。
引用
@article{arxiv.2408.14262,
title = {Self-supervised Speech Representations Still Struggle with African American Vernacular English},
author = {Kalvin Chang and Yi-Hui Chou and Jiatong Shi and Hsuan-Ming Chen and Nicole Holliday and Odette Scharenborg and David R. Mortensen},
journal= {arXiv preprint arXiv:2408.14262},
year = {2024}
}
备注
INTERSPEECH 2024