用三角分解一致性正则化端到端语音翻译
计算与语言
2022-05-26 v2 声音
音频与语音处理
摘要
端到端语音到文本翻译(E2E-ST)因其更少的错误传播、更低延迟和更少参数而日益流行。给定三元组训练语料 ,传统的高质量 E2E-ST 系统利用 对预训练模型,然后利用 对进一步优化。然而,该过程在每个阶段仅涉及二元组数据,这种松散耦合未能充分利用三元组数据之间的关联。本文中,我们试图基于语音输入对转录和翻译的联合概率建模,以直接利用此类三元组数据。在此基础上,我们提出一种新颖的模型训练正则化方法,以改善三元组数据中双路径分解的一致性,该一致性在理论上应相等。为实现此目标,我们在模型训练目标中引入两个 Kullback-Leibler 散度正则化项,以减小双路径输出概率之间的失配。随后,训练良好的模型可通过预定义的早停标签自然转化为 E2E-ST 模型。在 MuST-C 基准上的实验表明,我们所提方法在所有 8 个语言对上显著优于最先进的 E2E-ST 基线,同时在自动语音识别任务中取得更好性能。我们的代码已在 https://github.com/duyichao/E2E-ST-TDA 开源。
引用
@article{arxiv.2112.10991,
title = {Regularizing End-to-End Speech Translation with Triangular Decomposition Agreement},
author = {Yichao Du and Zhirui Zhang and Weizhi Wang and Boxing Chen and Jun Xie and Tong Xu},
journal= {arXiv preprint arXiv:2112.10991},
year = {2022}
}
备注
AAAI 2022