中文

AccentFold:穿越非洲口音之旅——面向目标口音的零样本ASR自适应

计算与语言 2024-02-06 v2 声音 音频与语音处理

摘要

尽管语音识别取得了进步,但带口音的语音仍然具有挑战性。虽然先前的方法侧重于建模技术或创建带口音的语音数据集,但对于众多口音(尤其是在非洲背景下)收集足够的数据,由于其巨大的多样性和相关的预算限制,仍然不切实际。为了应对这些挑战,我们提出了AccentFold,一种利用学习到的口音嵌入之间的空间关系来改进下游自动语音识别的方法。我们对代表100多种非洲口音的语音嵌入进行的探索性分析揭示了有趣的空间口音关系,突出了地理和谱系上的相似性,捕捉了从语音中经验学习到的一致音系和形态规律。此外,我们发现了Ethnologue先前未描述过的口音关系。通过实证评估,我们证明了AccentFold的有效性:对于分布外口音,基于AccentFold信息采样口音子集进行训练,在相对词错误率上比强基线方法提升了4.6%。AccentFold为改进带口音语音的ASR性能提供了一种有前景的方法,特别是在数据稀缺和预算限制构成重大挑战的非洲口音背景下。我们的发现强调了利用语言关系来改进零样本ASR对目标口音自适应的潜力。

关键词

引用

@article{arxiv.2402.01152,
  title  = {AccentFold: A Journey through African Accents for Zero-Shot ASR Adaptation to Target Accents},
  author = {Abraham Toluwase Owodunni and Aditya Yadavalli and Chris Chinenye Emezue and Tobi Olatunji and Clinton C Mbataku},
  journal= {arXiv preprint arXiv:2402.01152},
  year   = {2024}
}

备注

Accepted to EACL Findings 2024