用于无界限语音同步翻译的层次化策略优化
计算与语言
2026-04-24 v1
摘要
同步语音翻译(SST)在接收部分语音输入时生成翻译。近期进展表明,大型语言模型(LLM)可显著提升SST质量,但代价为高计算开销。为降低此开销,先前工作将SST重新定义为多轮对话任务,使LLM的键值(KV)缓存得到完全复用,消除冗余特征重计算。然而,该方法依赖于以对话形式的监督微调(SFT)数据,而此类人工标注数据稀缺,现有合成方法无法保证数据质量。本文提出一种层次化策略优化(HPO)方法,对在不完美SFT数据上训练的模型进行后训练。我们引入一种层次化奖励,以平衡翻译质量和延迟目标。在英语到中文、德语、日语的实验中,分别实现了超过+7分的COMET分数和+1.25分的MetricX分数,延迟为1.5秒。 comprehensive ablation研究进一步验证了不同质量奖励、层次化奖励公式以及分段策略的有效性。代码可在 https://github.com/owaski/HPO 查找。
引用
@article{arxiv.2604.21045,
title = {Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech},
author = {Siqi Ouyang and Shuoyang Ding and Oleksii Hrinchuk and Vitaly Lavrukhin and Brian Yan and Boris Ginsburg and Lei Li},
journal= {arXiv preprint arXiv:2604.21045},
year = {2026}
}
备注
ACL 2026 Oral