高保真同声语音翻译
计算与语言
2025-02-27 v2 声音
音频与语音处理
摘要
我们介绍了 Hibiki,一个用于同声语音翻译的仅解码器模型。Hibiki 利用多流语言模型同步处理源语音和目标语音,并联合生成文本和音频令牌以执行语音到文本和语音到语音的翻译。此外,我们解决了同声传译的根本挑战,与交替传译(等待源话语结束后才开始翻译)不同,同声传译需要调整其流程,以实时、逐块地积累足够的上下文来产生正确的翻译。为此,我们引入了一种弱监督方法,该方法利用现成文本翻译系统的困惑度来基于每个单词识别最佳延迟,并创建对齐的合成数据。经过监督训练后,Hibiki 通过普通的温度采样执行自适应、同步的语音翻译。在法英同声语音翻译任务上,Hibiki 在翻译质量、说话人保真度和自然度方面展示了最先进的性能。此外,其推理过程的简单性使其兼容批量翻译甚至实时设备端部署。我们提供了示例以及模型和推理代码。
引用
@article{arxiv.2502.03382,
title = {High-Fidelity Simultaneous Speech-To-Speech Translation},
author = {Tom Labiausse and Laurent Mazaré and Edouard Grave and Patrick Pérez and Alexandre Défossez and Neil Zeghidour},
journal= {arXiv preprint arXiv:2502.03382},
year = {2025}
}