InfiniSST: 利用大语言模型实现无界语音的同步翻译
计算与语言
2025-06-17 v2 人工智能
摘要
无界流式语音的同步翻译仍然是一个具有挑战性的问题,因为需要有效处理历史语音上下文和过去的翻译,以便在质量与延迟(包括计算开销)之间取得平衡。大多数先前工作假设预分段语音,限制了其在现实世界中的适用性。在本文中,我们提出了InfiniSST,一种将SST公式化为多轮对话任务的新方法,实现了无界语音的无缝翻译。我们利用MuST-C构建翻译轨迹和鲁棒片段,并在训练过程中进行多延迟增强,同时开发了一种键值(KV)缓存管理策略以促进高效推理。在MuST-C En-Es、En-De和En-Zh上的实验表明,与基线相比,InfiniSST将计算感知延迟降低了0.5到1秒,同时保持了相同的翻译质量。消融研究进一步验证了我们的数据构建和缓存管理策略的贡献。我们在https://github.com/LeiLiLab/InfiniSST发布了代码和演示。
引用
@article{arxiv.2503.02969,
title = {InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Model},
author = {Siqi Ouyang and Xi Xu and Lei Li},
journal= {arXiv preprint arXiv:2503.02969},
year = {2025}
}
备注
ACL 2025 Findings