多语言对齐中奖励模型的跨语言迁移
计算与语言
2025-01-24 v2 人工智能
摘要
基于人类反馈的强化学习(RLHF)被证明在很大程度上受益于精确的奖励模型(RM)。然而,最近关于奖励建模方案的研究偏向于英语,限制了RLHF在多语言对齐中的适用性。在这项工作中,我们研究了在不同语言(主要是英语)中训练的RM的跨语言迁移。我们的实验结果表明,英语RM具有很强的跨语言迁移能力,在Multilingual RewardBench上的平均提升超过目标语言RM 3~4%。此外,我们通过表示变化分析了RM的跨语言迁移。最后,我们进行了多语言对齐,以举例说明RM中的跨语言迁移如何传播到增强的多语言指令遵循能力,并对现成的RM进行了广泛分析。我们发布了代码、模型和数据。
引用
@article{arxiv.2410.18027,
title = {Cross-lingual Transfer of Reward Models in Multilingual Alignment},
author = {Jiwoo Hong and Noah Lee and Rodrigo Martínez-Castaño and César Rodríguez and James Thorne},
journal= {arXiv preprint arXiv:2410.18027},
year = {2025}
}
备注
Accepted to NAACL 2025