面向移动端语音翻译的延迟瓶颈:基于对齐的流式 MT 级联方法
计算与语言
2025-08-20 v1 人工智能
摘要
本文针对将自动语音识别 (ASR) 与机器翻译 (MT) 集成以实现实时移动端流式语音翻译所面临的挑战进行了系统性探讨。虽然基于循环神经网络 transducer (RNN-T) 的最先进 ASR 系统可实现实时转录,但实现实时流式翻译仍是一大挑战。为平衡翻译质量与延迟,我们提出了一种同时翻译方法,有效平衡了翻译质量与延迟。我们还研究了 ASR 与 MT 的高效集成,利用 ASR 生成的语言线索管理上下文,运用超时控制和强制终止等高效束搜索修剪技术维持系统的实时因子。我们将方法应用于移动端双语对话语音翻译,实验表明我们的方法在延迟和质量方面均优于基线。值得注意的是,我们的技术将非流式翻译系统的质量差距缩小到了与之相当,为实现更准确、更高效的实时语音翻译铺平了道路。
引用
@article{arxiv.2508.13358,
title = {Overcoming Latency Bottlenecks in On-Device Speech Translation: A Cascaded Approach with Alignment-Based Streaming MT},
author = {Zeeshan Ahmed and Frank Seide and Niko Moritz and Ju Lin and Ruiming Xie and Simone Merello and Zhe Liu and Christian Fuegen},
journal= {arXiv preprint arXiv:2508.13358},
year = {2025}
}