中文

Saar-Voice:多说话人萨尔布鲁克恩方言语音语料库

计算与语言 2026-04-14 v1

摘要

自然语言处理 (NLP) 和语音技术近年来取得了显著进展;然而,它们仍主要聚焦于标准化的语言变体。尽管方言在文化意义和广泛使用方面至关重要,但在语言资源和计算模型中仍被严重不足,这导致性能差异。为此,我们介绍 Saar-Voice,这是一个用于萨尔布鲁克恩 (Saarbrücken) 德语方言的六小时语音语料库。该数据集通过首先收集通过扫描书籍和本地材料获取的文本来创建。其中的一部分文本由九名说话人录制,我们对文本和语音组件进行分析,以评估数据集的特征和质量。我们讨论了正字法和说话人变异性相关的 методological 挑战,探索了 grapheme-to-phoneme (G2P) 转换。 resulting corpus 提供了对齐的文本和音频表示。这为未来研究在低资源场景下的方言感知文本转语音 (TTS),包括零样本和少样本模型适应,提供了基础。

关键词

引用

@article{arxiv.2604.11803,
  title  = {Saar-Voice: A Multi-Speaker Saarbr\"ucken Dialect Speech Corpus},
  author = {Lena S. Oberkircher and Jesujoba O. Alabi and Dietrich Klakow and Jürgen Trouvain},
  journal= {arXiv preprint arXiv:2604.11803},
  year   = {2026}
}

备注

accepted at DialRes-LREC26