通过融合语音与文本改进语音翻译
计算与语言
2023-05-24 v1 声音
音频与语音处理
摘要
在语音翻译中,利用多模态数据来提升模型性能并解决单一模态的局限已显示出显著成效。本文中,我们利用了语音和文本这两种异质模态的互补优势。我们观察到它们之间三个层次的模态鸿沟,即模态输入表示、模态语义和模态隐藏状态。为应对这些鸿沟,我们提出了 \textbf{F}use-\textbf{S}peech-\textbf{T}ext(\textbf{FST}),一种支持三种不同输入模态进行翻译的跨模态模型:语音、文本和融合语音-文本。我们利用多种跨模态对齐技术,并开展全面分析以评估其对语音翻译、机器翻译和融合语音-文本翻译的影响。我们在 MuST-C、GigaST 和 newstest 基准上评估 FST。实验表明,所提 FST 在 MuST-C EnDe/Es/Fr 上平均达到 34.0 BLEU(相较 SOTA +1.1 BLEU)。进一步实验证明,FST 在 MT 任务上未像先前工作观察到的那样退化,反而比预训练 MT 模型平均提升 3.2 BLEU。
引用
@article{arxiv.2305.14042,
title = {Improving speech translation by fusing speech and text},
author = {Wenbiao Yin and Zhicheng Liu and Chengqi Zhao and Tao Wang and Jian Tong and Rong Ye},
journal= {arXiv preprint arXiv:2305.14042},
year = {2023}
}