面向低资源台湾客家语语音处理的高效方言感知建模与条件化
计算与语言
2026-02-27 v1 人工智能
声音
音频与语音处理
摘要
台湾客家语是一种低资源且濒危的语言,对自动语音识别(ASR)构成重大挑战,包括高方言变异性以及两种不同书写系统(汉字与拼音)的存在。传统ASR模型在此背景下常遇到困难,因其倾向于将关键语言内容与方言在语音和词汇维度上的特定变异性混合。为应对这些挑战,我们提出一种基于循环神经网络映射 transducer(RNN-T)的统一框架。核心方法引入方言感知建模策略,以分离方言“风格”与语言“内容”,以增强模型学习鲁健和泛化表征的能力。此外,该框架采用参数高效的预测网络,以并行建模ASR(汉字与拼音)。我们展示,这些任务之间形成强大的协同作用,其中跨脚本目标作为互惠正则器,以提升主要ASR任务。在HAT语料库上的实验表明,我们的模型在汉字ASR和拼音ASR分别实现了57.00%和40.41%的相对错误率降低。迄今为止,这是首个系统性调查台湾客家语方言变异对ASR影响的研究,也是首个能够同时处理此类任务的单一模型。
引用
@article{arxiv.2602.22522,
title = {Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing},
author = {An-Ci Peng and Kuan-Tang Huang and Tien-Hong Lo and Hung-Shin Lee and Hsin-Min Wang and Berlin Chen},
journal= {arXiv preprint arXiv:2602.22522},
year = {2026}
}
备注
Accepted to LREC 2026