中文

CantoASR:面向低资源粤语的语音识别-LALM 协同

计算与语言 2025-11-07 v1 声音

摘要

自动语音识别(ASR)是语言可访问性的关键环节,但低资源粤语因缺乏标注数据、六个音调、声调变化和方言变体而具有挑战性。现有 ASR 模型如 Whisper 常因高词错误率受影响。大型音频语言模型(LALM)则可利用更广泛的上下文推理,但仍需要明确的语调和韵律声学线索。我们引入 CantoASR,一个协作式 ASR-LALM 错误纠正框架,集成了用于声学特征提取的强制对齐、用于改进语调判别的 LoRA 微调 Whisper 以及用于韵律感知纠正的指令调优 Qwen-Audio。针对自发粤语数据进行评估,结果显示其在 Whisper-Large-V3 方面实现了显著的 CER 提升。这些发现表明,通过整合声学线索与 LALM 推理,可为低资源语调和方言 ASR 提供可扩展的策略。

关键词

引用

@article{arxiv.2511.04139,
  title  = {CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese},
  author = {Dazhong Chen and Yi-Cheng Lin and Yuchen Huang and Ziwei Gong and Di Jiang and Zeying Xie and Yi R. and Fung},
  journal= {arXiv preprint arXiv:2511.04139},
  year   = {2025}
}