fairseq S2T:基于 fairseq 的快速语音到文本建模
计算与语言
2022-06-15 v2 音频与语音处理
摘要
我们介绍 fairseq S2T,一个用于语音到文本(S2T)建模任务(如端到端语音识别和语音到文本翻译)的 fairseq 扩展。它遵循 fairseq 为可扩展性和可扩展性(extensibility)的精心设计。我们提供从数据预处理、模型训练到离线(在线)推断的端到端工作流。我们实现了最先进的基于 RNN、基于 Transformer 以及基于 Conformer 的模型,并开源了详细的训练方案。fairseq 的机器翻译模型和语言模型可无缝集成到 S2T 工作流中用于多任务学习或迁移学习。fairseq S2T 文档与示例可在 https://github.com/pytorch/fairseq/tree/master/examples/speech_to_text 获取。
引用
@article{arxiv.2010.05171,
title = {fairseq S2T: Fast Speech-to-Text Modeling with fairseq},
author = {Changhan Wang and Yun Tang and Xutai Ma and Anne Wu and Sravya Popuri and Dmytro Okhonko and Juan Pino},
journal= {arXiv preprint arXiv:2010.05171},
year = {2022}
}
备注
Post-conference updates (accepted to AACL 2020 Demo)