具有可微分割的端到端同步语音翻译
计算与语言
2023-11-13 v2 人工智能
声音
音频与语音处理
摘要
端到端同步语音翻译(SimulST)在接收流式语音输入(又称流式语音翻译)的同时输出翻译,因此需要分割语音输入并基于当前接收到的语音进行翻译。然而,在不利于翻译的时刻分割语音输入会破坏声学完整性并对翻译模型性能产生不利影响。因此,学习在那些有利于翻译模型产生高质量翻译的时刻分割语音输入是 SimulST 的关键。现有 SimulST 方法,无论是使用固定长度分割还是外部分割模型,总是将分割与底层翻译模型分离,这种鸿沟导致分割结果未必有利于翻译过程。在本文中,我们提出用于 SimulST 的可微分割(DiSeg),以直接从底层翻译模型学习分割。DiSeg 通过所提出的期望训练将硬分割变为可微的,使其能够与翻译模型联合训练,从而学习有益于翻译的分割。实验结果表明,DiSeg 达到了最先进的性能并展现出优越的分割能力。
引用
@article{arxiv.2305.16093,
title = {End-to-End Simultaneous Speech Translation with Differentiable Segmentation},
author = {Shaolei Zhang and Yang Feng},
journal= {arXiv preprint arXiv:2305.16093},
year = {2023}
}
备注
Accepted at ACL 2023 findings