面向语音翻译的跨模态对比学习
计算与语言
2022-05-06 v1 音频与语音处理
摘要
我们如何为口语话语及其书面文本学习统一的表示?为语义相似的语音与文本学习相似表示对语音翻译十分重要。为此,我们提出 ConST,一种用于端到端语音到文本翻译的跨模态对比学习方法。我们在流行基准 MuST-C 上评估了 ConST 与多种先前基线。实验表明,所提出的 ConST 持续优于先前方法,并取得了 29.4 的平均 BLEU。分析进一步证实 ConST 确实缩小了不同模态间的表示差距——其学到的表示将跨模态语音–文本检索的准确率从 4% 提升至 88%。代码与模型见 https://github.com/ReneeYe/ConST。
引用
@article{arxiv.2205.02444,
title = {Cross-modal Contrastive Learning for Speech Translation},
author = {Rong Ye and Mingxuan Wang and Lei Li},
journal= {arXiv preprint arXiv:2205.02444},
year = {2022}
}
备注
NAACL 2022 main conference (Long Paper)