中文

硬要被听见:针对 phonologically complex、低资源濒卫语言的音素级 ASR 分析

计算与语言 2026-04-21 v1

摘要

我们提出了对两种低资源且音素结构复杂的东高加索语(Archi 和 Rutul)进行自动语音识别(ASR)的音素级分析,基于总计约 50 分钟和 1 小时 20 分钟的精选标准化语音-文本资源。整合现有录音与转录资料,并加工成适用于 ASR 训练与评估的形式。我们评估了多种最新音频和音频-语言模型,包括 wav2vec2、Whisper 和 Qwen2-Audio。对于 wav2vec2,我们引入了语言特定的音素词汇表,并采用启发式输出层初始化,实现了持续的性能提升,使其在极端低资源环境下的表现可与 Whisper 相当或更优。除常规词错率和字符错率外,我们进行了详细的音素级错误分析。我们发现,音素识别准确率与训练频率强相关,呈现出特征性的S型学习曲线。对于 Archi,此关系在 Whisper 中部分失效,指向模型特定的泛化效应,超出训练频率所能预测的范围。总体而言,结果表明,许多归因于音素结构复杂性的错误,更可由数据稀缺性来解释。这些发现表明,音素级评估对理解低资源、类型学复杂语言中的 ASR 行为具有重要价值。

关键词

引用

@article{arxiv.2604.18204,
  title  = {Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages},
  author = {V. S. D. S. Mahesh Akavarapu and Michael Daniel and Gerhard Jäger},
  journal= {arXiv preprint arXiv:2604.18204},
  year   = {2026}
}

备注

Accepted to ACL 2026 (Findings)