STEMM:基于语音-文本流形混合自学习的语音翻译方法
计算与语言
2022-03-22 v1 人工智能
摘要
如何在使用有限标注数据的情况下,为端到端语音到文本翻译(ST)学习更好的语音表示?现有技术常试图将强大的机器翻译(MT)能力迁移到ST中,却忽略了跨模态的表示差异。本文提出语音-文本流形混合(Speech-Text Manifold Mixup, STEMM)方法来校准这种差异。具体而言,我们将不同模态的表示序列进行混合,并将单模态语音序列和多模态混合序列并行输入翻译模型,在自学习框架下对其输出预测进行正则化。在MuST-C语音翻译基准上的实验及进一步分析表明,我们的方法有效缓解了跨模态表示差异,并在八个翻译方向上相比强基线取得了显著提升。
引用
@article{arxiv.2203.10426,
title = {STEMM: Self-learning with Speech-text Manifold Mixup for Speech Translation},
author = {Qingkai Fang and Rong Ye and Lei Li and Yang Feng and Mingxuan Wang},
journal= {arXiv preprint arXiv:2203.10426},
year = {2022}
}
备注
ACL 2022 main conference