中文

多语言对齐中奖励模型的跨语言迁移

计算与语言 2025-01-24 v2 人工智能

摘要

基于人类反馈的强化学习(RLHF)被证明在很大程度上受益于精确的奖励模型(RM)。然而,最近关于奖励建模方案的研究偏向于英语,限制了RLHF在多语言对齐中的适用性。在这项工作中,我们研究了在不同语言(主要是英语)中训练的RM的跨语言迁移。我们的实验结果表明,英语RM具有很强的跨语言迁移能力,在Multilingual RewardBench上的平均提升超过目标语言RM 3~4%。此外,我们通过表示变化分析了RM的跨语言迁移。最后,我们进行了多语言对齐,以举例说明RM中的跨语言迁移如何传播到增强的多语言指令遵循能力,并对现成的RM进行了广泛分析。我们发布了代码、模型和数据。

关键词

引用

@article{arxiv.2410.18027,
  title  = {Cross-lingual Transfer of Reward Models in Multilingual Alignment},
  author = {Jiwoo Hong and Noah Lee and Rodrigo Martínez-Castaño and César Rodríguez and James Thorne},
  journal= {arXiv preprint arXiv:2410.18027},
  year   = {2025}
}

备注

Accepted to NAACL 2025