推进低资源真实世界语音的语音转文本技术
计算与语言
2025-06-11 v1 人机交互
摘要
瑞士德语是一种低资源语言,由多种方言代表,这些方言与标准德语及彼此之间差异显著,且缺乏标准化的书面形式。因此,转录瑞士德语涉及将其翻译为标准德语。现有数据集多在受控环境中收集,产生了有效的语音转文本(STT)模型,但这些模型在处理自发会话语音时表现不佳。为此,本文引入了新的 SRB-300 数据集,这是一个包含 300 小时标注语音的语料库,收录了来自 39 个瑞士德语广播电台和电视台的真实世界长音频录音。它捕捉了在各种真实环境中录制的所有主要瑞士方言的自发语音,并克服了先前句子级语料库的局限性。我们在 SRB-300 数据集上微调了多个 OpenAI Whisper 模型,相较于之前的零样本性能指标取得了显著提升。词错误率(WER)的改进幅度在 19% 到 33% 之间,而 BLEU 分数提高了 8% 到 40%。表现最佳的微调模型 large-v3 达到了 17.1% 的 WER 和 74.8 的 BLEU 分数。这一进展对于为瑞士德语及其他低资源语言在真实世界语境中开发有效且鲁棒的 STT 系统至关重要。
引用
@article{arxiv.2506.08836,
title = {Advancing STT for Low-Resource Real-World Speech},
author = {Flavio D'Intino and Hans-Peter Hutter},
journal= {arXiv preprint arXiv:2506.08836},
year = {2025}
}
备注
Conference: HCI International 2025, 20 pages, 4 figures