中文

OWSM v4:通过数据扩展与清洗改进开放 Whisper 风格语音模型

计算与语言 2025-06-03 v1 声音 音频与语音处理

摘要

开放 Whisper 风格语音模型(OWSM)项目利用学术规模的资源开发了一系列完全开放的语音基础模型,但其训练数据仍然不足。本研究通过整合 YODAS(一个具有知识共享许可的大规模网络抓取数据集)来增强 OWSM。然而,由于 YODAS 原始未加筛选的特性,将其纳入并非易事,带来了诸如语言标签错误和音频-文本不对齐等挑战。为解决这些问题,我们利用公开工具包开发了一个可扩展的数据清洗流水线,生成了一个包含 75 种语言、166,000 小时语音的数据集。在这个精选数据集与现有 OWSM 数据上训练的 OWSM v4 新系列模型,在多语言基准测试上显著优于以往版本。我们的模型在多种场景下甚至匹敌或超越了 Whisper 和 MMS 等前沿工业模型。我们将通过 ESPnet 工具包公开发布清洗后的 YODAS 数据、预训练模型及所有相关脚本。

关键词

引用

@article{arxiv.2506.00338,
  title  = {OWSM v4: Improving Open Whisper-Style Speech Models via Data Scaling and Cleaning},
  author = {Yifan Peng and Shakeel Muhammad and Yui Sudo and William Chen and Jinchuan Tian and Chyi-Jiunn Lin and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2506.00338},
  year   = {2025}
}

备注

Accepted at INTERSPEECH 2025