TG-ASR:面向低资源环境的翻译引导语音识别 with 并行门控跨注意力机制
音频与语音处理
2026-02-26 v1 人工智能
计算与语言
声音
摘要
低资源自动语音识别(ASR)仍面临着重大挑战,主要原因是众多语言可获得的转录数据稀缺。尽管电视剧和在线视频中蕴含丰富的语音内容,但台湾福建语正是这一问题的典型例子,其转录记录往往稀缺,大多数可用的字幕仅提供为普通话。为此,我们提出了TG-ASR框架,用于台湾福建语戏剧语音识别,该框架利用多语言翻译嵌入来增强低资源环境下的识别性能。该框架以并行门控跨注意力(PGCA)机制为核心,该机制能够适配性地将来自各种辅助语言的嵌入向量集成到ASR解码器中。该机制实现了稳健的跨语言语义指导,同时确保优化稳定,最小化语言间的干扰。为支持后续研究,我们present了YT-THDC数据集,这是一个包含30小时台湾福建语戏剧语音、对齐的普通话字幕以及经人工核查的台湾福建语转录的数据集。通过系统实验与分析,我们识别出最能有效提升ASR性能的辅助语言,实现了14.77%的字符错误率相对降低,证明了翻译引导学习在实际应用中对底层语言有效性。
引用
@article{arxiv.2602.22039,
title = {TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition},
author = {Cheng-Yeh Yang and Chien-Chun Wang and Li-Wei Chen and Hung-Shin Lee and Hsin-Min Wang and Berlin Chen},
journal= {arXiv preprint arXiv:2602.22039},
year = {2026}
}
备注
Accepted to LREC 2026