中文

学习用于语音到文本翻译的共享语义空间

计算与语言 2021-08-06 v3

摘要

端到端语音翻译(ST)具有众多潜在应用和重大影响,长期被视为独立任务,未能充分汲取其兄弟任务——文本机器翻译(MT)的快速进展之力。由于文本与音频输入表示不同,模态鸿沟使得MT数据及其端到端模型与ST对应物不兼容。鉴于此障碍,我们提出用Chimera弥合这一表示鸿沟。通过将音频与文本特征投影到公共语义表示,Chimera统一了MT与ST任务,并将ST基准MuST-C和Augmented Librispeech上的性能提升至新的最先进水平。具体而言,Chimera在MuST-C EN-DE上取得27.1 BLEU,以+1.9 BLEU的优势改进SOTA。进一步的实验分析表明,共享语义空间确实传达了这两个任务间的共同知识,从而为跨模态扩充训练资源铺就新途径。代码、数据与资源见 https://github.com/Glaciohound/Chimera-ST。

关键词

引用

@article{arxiv.2105.03095,
  title  = {Learning Shared Semantic Space for Speech-to-Text Translation},
  author = {Chi Han and Mingxuan Wang and Heng Ji and Lei Li},
  journal= {arXiv preprint arXiv:2105.03095},
  year   = {2021}
}

备注

9 pages, 5 figures, Accepted by Findings of ACL 2021