基于隐对齐分割的长形式端到端语音翻译
计算与语言
2024-10-28 v1 人工智能
声音
音频与语音处理
摘要
当前的同步语音翻译模型仅能处理长达数秒的音频。当代数据集基于人工标注的转写与译文提供了句子级的oracle分割。然而,在真实世界中并无句子级分割可用。当前的语音分割方法要么分割质量较差,要么不得不以延迟换取质量。本文中,我们提出一种用于低延迟端到端语音翻译的新颖分割方法。我们利用带有ST CTC的现有语音翻译编码器-解码器架构,并表明其可在无监督且无额外参数的情况下执行分割任务。据我们所知,我们的方法是首个实现真正端到端同步语音翻译的方法,因为同一模型同时用于翻译与分割。在多种语言对及域内外数据上,我们表明所提方法以无额外计算成本取得了最先进的质量。
引用
@article{arxiv.2309.11384,
title = {Long-Form End-to-End Speech Translation via Latent Alignment Segmentation},
author = {Peter Polák and Ondřej Bojar},
journal= {arXiv preprint arXiv:2309.11384},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication