中文

SimulPL:在同声传译中对齐人类偏好

计算与语言 2025-02-06 v2 人工智能

摘要

同声传译(SiMT)在接收流式源输入的同时生成译文。这要求SiMT模型学习一种读/写策略,决定何时翻译以及何时等待更多源输入。大量语言研究表明,SiMT场景中的受众具有独特的偏好,例如准确的翻译、更简单的句法以及无不必要的延迟。使SiMT模型与这些人类偏好对齐对于提高其性能至关重要。然而,这一问题仍未得到探索。此外,SiMT任务的偏好优化也充满挑战。现有方法仅专注于优化生成的响应,忽略了偏好优化阶段与延迟相关的人类偏好以及读/写策略的优化。为解决这些挑战,我们提出了Simultaneous Preference Learning(SimulPL),一个为SiMT任务量身定制的偏好学习框架。在SimulPL框架中,我们将SiMT人类偏好归纳为五个方面:**翻译质量偏好**、**单调性偏好**、**关键点偏好**、**简洁性偏好**和**延迟偏好**。通过利用前四个偏好,我们构建人类偏好提示,以高效引导GPT-4/4o为SiMT任务生成偏好数据。在偏好优化阶段,SimulPL将**延迟偏好**整合到优化目标中,并使SiMT模型能够改进读/写策略,从而更有效地与人类偏好对齐。实验结果表明,在Zh→En、De→En和En→Zh的SiMT任务中,SimulPL在所有延迟级别上都表现出与人类偏好更好的对齐。我们的数据和代码将在https://github.com/EurekaForNLP/SimulPL上发布。

关键词

引用

@article{arxiv.2502.00634,
  title  = {SimulPL: Aligning Human Preferences in Simultaneous Machine Translation},
  author = {Donglei Yu and Yang Zhao and Jie Zhu and Yangyifan Xu and Yu Zhou and Chengqing Zong},
  journal= {arXiv preprint arXiv:2502.00634},
  year   = {2025}
}

备注

Accepted to ICLR 2025. 23 pages,13 figures,11 tables