中文

RO-N3WS:用于提升低资源 ASR 泛化能力的多样化罗马尼亚语语音基准数据集

计算与语言 2026-03-04 v1 机器学习 声音

摘要

我们介绍 RO-N3WS,一个旨在改善自动语音识别 (ASR) 中泛化能力、尤其是在低资源和 out-of-distribution (OOD) 条件下的罗马尼亚语语音数据集。RO-N3WS 包含超过 126 小时的已转录音频,来自广播新闻、文学语音书、电影对白、儿童故事以及对话式播客语音。这种多样性使我们能够在风格差异明显的不同 domain 上进行稳健的训练和 fine-tuning。我们评估了几种最先进的 ASR 系统 (Whisper、Wav2Vec 2.0) 在 zero-shot 和 fine-tuned 设置下的表现,并进行了使用具有表达性 TTS 模型生成的合成数据的受控比较。我们的结果表明,即使仅对来自 RO-N3WS 的真实语音进行有限的 fine-tuning,也显著优于 zero-shot baseline。我们将发布所有模型、脚本和数据划分,以支持 multilingual ASR、domain adaptation 和轻量级部署的可重复研究。

关键词

引用

@article{arxiv.2603.02368,
  title  = {RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks},
  author = {Alexandra Diaconu and Mădălina Vînaga and Bogdan Alexe},
  journal= {arXiv preprint arXiv:2603.02368},
  year   = {2026}
}