中文

TG-ASR:面向低资源环境的翻译引导语音识别 with 并行门控跨注意力机制

音频与语音处理 2026-02-26 v1 人工智能 计算与语言 声音

摘要

低资源自动语音识别(ASR)仍面临着重大挑战,主要原因是众多语言可获得的转录数据稀缺。尽管电视剧和在线视频中蕴含丰富的语音内容,但台湾福建语正是这一问题的典型例子,其转录记录往往稀缺,大多数可用的字幕仅提供为普通话。为此,我们提出了TG-ASR框架,用于台湾福建语戏剧语音识别,该框架利用多语言翻译嵌入来增强低资源环境下的识别性能。该框架以并行门控跨注意力(PGCA)机制为核心,该机制能够适配性地将来自各种辅助语言的嵌入向量集成到ASR解码器中。该机制实现了稳健的跨语言语义指导,同时确保优化稳定,最小化语言间的干扰。为支持后续研究,我们present了YT-THDC数据集,这是一个包含30小时台湾福建语戏剧语音、对齐的普通话字幕以及经人工核查的台湾福建语转录的数据集。通过系统实验与分析,我们识别出最能有效提升ASR性能的辅助语言,实现了14.77%的字符错误率相对降低,证明了翻译引导学习在实际应用中对底层语言有效性。

关键词

引用

@article{arxiv.2602.22039,
  title  = {TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition},
  author = {Cheng-Yeh Yang and Chien-Chun Wang and Li-Wei Chen and Hung-Shin Lee and Hsin-Min Wang and Berlin Chen},
  journal= {arXiv preprint arXiv:2602.22039},
  year   = {2026}
}

备注

Accepted to LREC 2026