中文

用于无界限语音同步翻译的层次化策略优化

计算与语言 2026-04-24 v1

摘要

同步语音翻译(SST)在接收部分语音输入时生成翻译。近期进展表明,大型语言模型(LLM)可显著提升SST质量,但代价为高计算开销。为降低此开销,先前工作将SST重新定义为多轮对话任务,使LLM的键值(KV)缓存得到完全复用,消除冗余特征重计算。然而,该方法依赖于以对话形式的监督微调(SFT)数据,而此类人工标注数据稀缺,现有合成方法无法保证数据质量。本文提出一种层次化策略优化(HPO)方法,对在不完美SFT数据上训练的模型进行后训练。我们引入一种层次化奖励,以平衡翻译质量和延迟目标。在英语到中文、德语、日语的实验中,分别实现了超过+7分的COMET分数和+1.25分的MetricX分数,延迟为1.5秒。 comprehensive ablation研究进一步验证了不同质量奖励、层次化奖励公式以及分段策略的有效性。代码可在 https://github.com/owaski/HPO 查找。

关键词

引用

@article{arxiv.2604.21045,
  title  = {Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech},
  author = {Siqi Ouyang and Shuoyang Ding and Oleksii Hrinchuk and Vitaly Lavrukhin and Brian Yan and Boris Ginsburg and Lei Li},
  journal= {arXiv preprint arXiv:2604.21045},
  year   = {2026}
}

备注

ACL 2026 Oral