中文

CLiFT-ASR:面向低资源台湾闽南语语音识别的跨语言微调框架

计算与语言 2025-11-11 v1 声音

摘要

针对台湾闽南语等低资源语言的自动语音识别(ASR)由于标注数据的稀缺性而具有挑战性。然而,直接在汉字转录上进行微调往往难以捕捉细致的语音和声调线索,而仅依赖罗马字训练则缺乏词汇和语法覆盖。此外,先前研究几乎未探索整合两种标注类型的阶段性策略。为此,我们提出 CLiFT-ASR,一种基于 Mandarin HuBERT 模型的跨语言微调框架,用于台湾闽南语。该框架采用两阶段过程:首先从语音闪台注释中学习声学和声调表示,然后从汉字转录中捕获词汇和语法。这种渐进式适应使语音声调与正字结构之间实现了有效的对齐。在 TAT-MOE 语料库上的实验表明,CLiFT-ASR 相较于强基线可实现约 24.88%24.88\% 的字符错误率(CER)相对降低。结果表明,CLiFT-ASR 为台湾闽南语 ASR 提供了有效且参数高效的解决方案,其潜力也有望惠及其他低资源语言场景。

关键词

引用

@article{arxiv.2511.06860,
  title  = {CLiFT-ASR: A Cross-Lingual Fine-Tuning Framework for Low-Resource Taiwanese Hokkien Speech Recognition},
  author = {Hung-Yang Sung and Chien-Chun Wang and Kuan-Tang Huang and Tien-Hong Lo and Yu-Sheng Tsao and Yung-Chang Hsu and Berlin Chen},
  journal= {arXiv preprint arXiv:2511.06860},
  year   = {2025}
}

备注

Accepted for an oral presentation at the 37th Conference on Computational Linguistics and Speech Processing (ROCLING 2025)