中文

级联语音翻译的紧密集成端到端训练

计算与语言 2020-11-25 v1 机器学习

摘要

级联语音翻译模型依赖于离散且不可微的转录文本,其提供来自源端的监督信号并有助于源语音与目标文本之间的转换。此类建模存在 ASR 与 MT 模型间的错误传播问题。直接语音翻译是一种避免错误传播的替代方法,但其性能通常落后于级联系统。为使用中间表示并保持端到端可训练性,已有研究提出采用两阶段模型,将识别器的隐藏向量传入 MT 模型的解码器并忽略 MT 编码器。本文探讨了将整个级联组件压缩为单一端到端可训练模型的可行性,通过联合优化 ASR 和 MT 模型的所有参数而不忽略任何已学习参数来实现。这是一种紧密集成的方法,其将重归一化的源词后验分布作为软决策而非独热向量传递,并支持反向传播。因此,它同时提供转录与翻译,并实现两者间的强一致性。我们在四种不同数据场景任务上的实验表明,该模型在 BLEU 上最高优于级联模型 1.8%,在 TER 上最高优于 2.0%,且优于直接模型。

关键词

引用

@article{arxiv.2011.12167,
  title  = {Tight Integrated End-to-End Training for Cascaded Speech Translation},
  author = {Parnia Bahar and Tobias Bieschke and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2011.12167},
  year   = {2020}
}

备注

8 pages, accepted at SLT2021