中文

基于隐对齐分割的长形式端到端语音翻译

计算与语言 2024-10-28 v1 人工智能 声音 音频与语音处理

摘要

当前的同步语音翻译模型仅能处理长达数秒的音频。当代数据集基于人工标注的转写与译文提供了句子级的oracle分割。然而,在真实世界中并无句子级分割可用。当前的语音分割方法要么分割质量较差,要么不得不以延迟换取质量。本文中,我们提出一种用于低延迟端到端语音翻译的新颖分割方法。我们利用带有ST CTC的现有语音翻译编码器-解码器架构,并表明其可在无监督且无额外参数的情况下执行分割任务。据我们所知,我们的方法是首个实现真正端到端同步语音翻译的方法,因为同一模型同时用于翻译与分割。在多种语言对及域内外数据上,我们表明所提方法以无额外计算成本取得了最先进的质量。

关键词

引用

@article{arxiv.2309.11384,
  title  = {Long-Form End-to-End Speech Translation via Latent Alignment Segmentation},
  author = {Peter Polák and Ondřej Bojar},
  journal= {arXiv preprint arXiv:2309.11384},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication