学习何时说话:基于离线模型的同步语音到语音翻译的延迟与质量权衡
计算与语言
2023-06-05 v1 机器学习
声音
音频与语音处理
摘要
近期语音到语音翻译(S2ST)的工作主要集中于离线设置,即在给出任何输出之前完整输入话语可用。然而,这在许多真实世界场景中并不合理。在延迟敏感的应用中,翻译应在输入信息出现时立即说出,而非等待完整话语。在这项工作中,我们引入了一个面向真实世界用例的同步 S2ST 系统。我们的系统支持从 57 种语言到英语的翻译,具有可调参数用于动态调整输出的延迟——包括四种用于确定何时说出输出序列的策略。我们表明,这些策略在仅比 Greedy(wait-)基线最小增加延迟的情况下,实现了离线级别的准确率。我们开源了我们的评估代码和交互式测试脚本,以助力未来的 SimulS2ST 研究和应用开发。
引用
@article{arxiv.2306.01201,
title = {Learning When to Speak: Latency and Quality Trade-offs for Simultaneous Speech-to-Speech Translation with Offline Models},
author = {Liam Dugan and Anshul Wadhawan and Kyle Spence and Chris Callison-Burch and Morgan McGuire and Victor Zordan},
journal= {arXiv preprint arXiv:2306.01201},
year = {2023}
}
备注
To appear at INTERSPEECH 2023