中文

GigaST:一个 10,000 小时的伪语音翻译语料库

计算与语言 2023-06-07 v2 声音 音频与语音处理

摘要

本文介绍了 GigaST,一个大规模伪语音翻译 (ST) 语料库。我们通过将英文 ASR 语料库 GigaSpeech 中的文本翻译为德文和中文来创建该语料库。训练集由一个强大的机器翻译系统进行翻译,测试集由人工翻译。使用我们的语料库训练的 ST 模型在 MuST-C 英德基准测试集上取得了新的 state-of-the-art 结果。我们提供了翻译过程的详细描述并验证了其质量。我们公开翻译后的文本数据,以期促进语音翻译方面的研究。此外,我们还在 NeurST 上发布了训练脚本,以便于复现我们的系统。GigaST 数据集可在 https://st-benchmark.github.io/resources/GigaST 获取。

关键词

引用

@article{arxiv.2204.03939,
  title  = {GigaST: A 10,000-hour Pseudo Speech Translation Corpus},
  author = {Rong Ye and Chengqi Zhao and Tom Ko and Chutong Meng and Tao Wang and Mingxuan Wang and Jun Cao},
  journal= {arXiv preprint arXiv:2204.03939},
  year   = {2023}
}

备注

Accepted at Interspeech 2023. GigaST dataset is available at https://st-benchmark.github.io/resources/GigaST