中文

面向语音翻译的跨模态对比学习

计算与语言 2022-05-06 v1 音频与语音处理

摘要

我们如何为口语话语及其书面文本学习统一的表示?为语义相似的语音与文本学习相似表示对语音翻译十分重要。为此,我们提出 ConST,一种用于端到端语音到文本翻译的跨模态对比学习方法。我们在流行基准 MuST-C 上评估了 ConST 与多种先前基线。实验表明,所提出的 ConST 持续优于先前方法,并取得了 29.4 的平均 BLEU。分析进一步证实 ConST 确实缩小了不同模态间的表示差距——其学到的表示将跨模态语音–文本检索的准确率从 4% 提升至 88%。代码与模型见 https://github.com/ReneeYe/ConST。

关键词

引用

@article{arxiv.2205.02444,
  title  = {Cross-modal Contrastive Learning for Speech Translation},
  author = {Rong Ye and Mingxuan Wang and Lei Li},
  journal= {arXiv preprint arXiv:2205.02444},
  year   = {2022}
}

备注

NAACL 2022 main conference (Long Paper)