中文

CMOT:基于最优传输的跨模态混合用于语音翻译

计算与语言 2023-05-26 v2 人工智能 声音 音频与语音处理

摘要

端到端语音翻译(ST)是将源语言语音信号翻译为目标语言文本的任务。作为跨模态任务,端到端ST在有限数据下难以训练。现有方法常试图从机器翻译(MT)迁移知识,但其性能受限于语音与文本间的模态鸿沟。本文提出基于最优传输的跨模态混合CMOT以克服模态鸿沟。我们通过最优传输找到语音与文本序列间的对齐,然后利用该对齐在词元级别混合来自不同模态的序列。在MuST-C ST基准上的实验表明,CMOT在8个翻译方向上平均BLEU达到30.0,优于以往方法。进一步分析显示CMOT能自适应地找到模态间对齐,有助于缓解语音与文本间的模态鸿沟。代码已公开于https://github.com/ictnlp/CMOT。

关键词

引用

@article{arxiv.2305.14635,
  title  = {CMOT: Cross-modal Mixup via Optimal Transport for Speech Translation},
  author = {Yan Zhou and Qingkai Fang and Yang Feng},
  journal= {arXiv preprint arXiv:2305.14635},
  year   = {2023}
}

备注

ACL 2023 main conference