中文

AdaCS:用于增强代码切换语音识别的自适应归一化

计算与语言 2025-01-14 v1 人工智能 声音 音频与语音处理

摘要

句内代码切换 (CS) 指的是在单个语音单元内发生语言之间的交替,是自动语音识别 (ASR) 系统面临的重要挑战之一。例如,当越南语说话者在其语音中使用外来专有名词或专业术语时。ASR 系统往往难以准确转录句内代码切换,因为其训练仅使用单语数据且代码切换的性质难以预测。这一问题在低资源语言上更为突出,由于数据稀缺,难以开发出鲁健的模型。本文提出 AdaCS,一种集成自适应偏置注意力模块 (BAM) 的归一化模型,融入 encoder-decoder 网络中。该新方法为 unseen 领域的代码切换 ASR 提供了稳健解决方案,显著提升了该领域的贡献。通过利用 BAM 来识别和归一化 CS 短语,AdaCS 具备与推断时提供的偏置词表列表相结合的自适应能力。我们的方法在各种领域中展现出卓越的性能和处理未见 CS 短语的能力。实验表明,AdaCS 在越南语代码切换语音识别归一化任务上超越了前沿方法,在两个提出的测试集上分别实现了 56.2% 和 36.8% 的 WER 显著降低。

关键词

引用

@article{arxiv.2501.07102,
  title  = {AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR},
  author = {The Chuong Chu and Vu Tuan Dat Pham and Kien Dao and Hoang Nguyen and Quoc Hung Truong},
  journal= {arXiv preprint arXiv:2501.07102},
  year   = {2025}
}

备注

Accepted at ICASSP 2025