Breeze Taigi:台湾闽南语语音识别与合成的基准与模型
计算与语言
2026-03-23 v1 人工智能
摘要
台湾闽南语(Taigi)为推进可推广至多样语言语境的语音技术方法提供了独特机遇。我们引入 Breeze Taigi,一个以标准化基准评估 Taigi 语音识别与合成系统的综合框架。我们的首要贡献是一种可复现的评估方法论,利用台湾闽南语资源实现平行化。我们提供 30 份精心挑选的闽南语-华语音频对,来自台湾行政院公开的公共服务公告,并配备规范化的参考转录文本。我们确立字符错误率(CER)作为标准指标,并实施规范化程序,以实现公平的跨系统比较。为演示基准的实用性并提供参考实现,我们开发了语音识别与合成模型,采用一种方法论,利用现有的台湾闽南语资源和大规模合成数据生成。具体而言,我们在约 1 万小时的 Taigi 合成语音数据上微调 Whisper 模型。我们的语音识别模型在该基准上实现 30.13% 的平均 CER,优于现有商业和科研系统。通过提供标准化的评估协议、多样化的训练数据集以及开放的基线模型,我们提供了一个可复制的框架,所采用的方法论可应用于各种语言语境。
关键词
引用
@article{arxiv.2603.19259,
title = {Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis},
author = {Yu-Siang Lan and Chia-Sheng Liu and Yi-Chang Chen and Po-Chun Hsu and Allyson Chiu and Shun-Wen Lin and Da-shan Shiu and Yuan-Fu Liao},
journal= {arXiv preprint arXiv:2603.19259},
year = {2026}
}