中文

M-Adapter:面向端到端语音到文本翻译的模态适配

计算与语言 2022-07-05 v1 机器学习 声音 音频与语音处理

摘要

端到端语音到文本翻译模型通常以预训练语音编码器和预训练文本解码器初始化。这导致预训练与微调之间存在显著的训练鸿沟,主要源于编码器输出的语音与解码器输入的文本之间的模态差异。在本工作中,我们旨在弥合语音与文本之间的模态鸿沟以提升翻译质量。我们提出 M-Adapter,一种基于 Transformer 的新颖模块,将语音表征适配为文本。在压缩语音序列的同时,M-Adapter 通过建模语音序列的全局与局部依赖,产生语音到文本翻译所需的特征。我们的实验结果表明,在 Must-C En\rightarrowDE 数据集上,我们的模型比强基线最高高出 1 个 BLEU 分数。\footnote{我们的代码见 https://github.com/mingzi151/w2v2-st。}

关键词

引用

@article{arxiv.2207.00952,
  title  = {M-Adapter: Modality Adaptation for End-to-End Speech-to-Text Translation},
  author = {Jinming Zhao and Hao Yang and Ehsan Shareghi and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2207.00952},
  year   = {2022}
}

备注

Interspeech2022