中文

SeqPO-SiMT:面向同声传译的序列化策略优化

计算与语言 2025-05-28 v1 人工智能 机器学习

摘要

我们提出了 SeqPO-SiMT(面向同声传译的序列化策略优化),这是一个新的策略优化框架,它将同声传译(SiMT)任务定义为一个序列决策问题,并引入定制化的奖励机制,以在降低延迟的同时提升翻译质量。与通常应用于单步任务的 PPO 和 DPO 等主流的基于人类反馈的强化学习(RLHF)方法不同,SeqPO-SiMT 有效地解决了多步的同声传译任务。这一直观的框架允许同声传译大语言模型(LLMs)利用定制化的奖励来模拟和优化同声传译过程。我们在六个来自不同领域的英译中和中译英同声传译任务数据集上进行了实验,结果表明 SeqPO-SiMT 始终能在更低的延迟下实现显著更高的翻译质量。特别是在 NEWSTEST2021 英译中数据集上,SeqPO-SiMT 的 COMET 得分比监督微调(SFT)模型高出 1.13 分,同时平均延迟降低了 6.17。尽管同声传译可用的上下文远少于离线翻译,但 SeqPO-SiMT 在 7B 大语言模型上的同声传译结果惊人地媲美了高性能大语言模型(包括 Qwen-2.5-7B-Instruct 和 LLaMA-3-8B-Instruct)的离线翻译效果。

关键词

引用

@article{arxiv.2505.20622,
  title  = {SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation},
  author = {Ting Xu and Zhichao Huang and Jiankai Sun and Shanbo Cheng and Wai Lam},
  journal= {arXiv preprint arXiv:2505.20622},
  year   = {2025}
}

备注

Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)