使用开源工具包与公开数据复现Whisper风格训练
计算与语言
2023-10-26 v3 声音
音频与语音处理
摘要
在大规模数据上预训练语音模型已取得显著成功。OpenAI Whisper是一个在多语言多任务数据上以680k小时监督语音数据训练的模型。即使在零样本设置下,它也能很好地泛化到各类语音识别与翻译基准。然而,开发此类模型的完整流程(从数据收集到训练)并不公开,这使得研究人员难以进一步提升其性能并解决与训练相关的问题,如效率、鲁棒性、公平性与偏差。本工作提出开放Whisper风格语音模型(OWSM),其使用开源工具包与公开数据复现Whisper风格训练。OWSM甚至支持更多翻译方向,且训练可更高效。我们将公开发布用于数据准备、训练、推理与打分的所有脚本,以及预训练模型与训练日志,以推动开放科学。
引用
@article{arxiv.2309.13876,
title = {Reproducing Whisper-Style Training Using an Open-Source Toolkit and Publicly Available Data},
author = {Yifan Peng and Jinchuan Tian and Brian Yan and Dan Berrebbi and Xuankai Chang and Xinjian Li and Jiatong Shi and Siddhant Arora and William Chen and Roshan Sharma and Wangyou Zhang and Yui Sudo and Muhammad Shakeel and Jee-weon Jung and Soumi Maiti and Shinji Watanabe},
journal= {arXiv preprint arXiv:2309.13876},
year = {2023}
}
备注
Accepted at ASRU 2023