中文

端到端语音到文本翻译中一致性正则化的实证研究

计算与语言 2023-08-29 v1

摘要

一致性正则化方法,如 R-Drop (Liang et al., 2021) 与 CrossConST (Gao et al., 2023),已在神经机器翻译 (NMT) 领域取得令人瞩目的有监督与零样本性能。我们是否也能借助一致性正则化提升端到端 (E2E) 语音到文本翻译 (ST)?本文中,我们对模态内与跨模态一致性进行实证研究,并提出两种训练策略 SimRegCR 与 SimZeroCR,用于常规与零样本场景下的 E2E ST。在 MuST-C 基准上的实验表明,我们的方法在大多数翻译方向上取得了最先进 (SOTA) 性能。分析证明,模态内一致性带来的正则化(而非模态鸿沟)对常规 E2E ST 至关重要,且跨模态一致性可缩小模态鸿沟并提升零样本 E2E ST 性能。

关键词

引用

@article{arxiv.2308.14482,
  title  = {An Empirical Study of Consistency Regularization for End-to-End Speech-to-Text Translation},
  author = {Pengzhi Gao and Ruiqing Zhang and Zhongjun He and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2308.14482},
  year   = {2023}
}