中文

JoeyS2T:基于 JoeyNMT 的极简语音到文本建模

计算与语言 2022-10-07 v1 声音 音频与语音处理

摘要

JoeyS2T 是 JoeyNMT 的扩展,用于自动语音识别和端到端语音翻译等语音到文本任务。它继承了 JoeyNMT 这一基于 PyTorch 构建的极简 NMT 工具包的核心哲学,追求简洁与易用。JoeyS2T 的工作流程是自包含的,从数据预处理、模型训练与预测到评估,并无缝集成到 JoeyNMT 紧凑简单的代码库中。在 JoeyNMT 最先进的基于 Transformer 的编码器-解码器架构之上,JoeyS2T 提供了面向语音的组件,如卷积层、SpecAugment、CTC 损失和 WER 评估。尽管与先前实现相比更为简单,JoeyS2T 在英语语音识别和英德语音翻译基准上表现具有竞争力。该实现附有逐步教程,并可访问 https://github.com/may-/joeys2t。

关键词

引用

@article{arxiv.2210.02545,
  title  = {JoeyS2T: Minimalistic Speech-to-Text Modeling with JoeyNMT},
  author = {Mayumi Ohta and Julia Kreutzer and Stefan Riezler},
  journal= {arXiv preprint arXiv:2210.02545},
  year   = {2022}
}

备注

EMNLP 2022 demo track