CroCo:基于自生成文本的跨语言对比式偏好调优
计算与语言
2026-05-27 v1 人工智能
摘要
先前研究表明,通过奖励分数控制大语言模型自生成响应之间的对比性,可改善英语下游偏好调优效果。我们将该方法扩展到多个语言,在14种高资源和低资源语言上评估了两个模型,涵盖多样化任务。我们的核心发现是,基于自生成文本的跨语言对比式偏好调优(CroCo)可实现无需语言特定偏好标注的迁移。基于多语言基础模型训练的奖励模型在大多数语言上产生有用的同语言排序,单语或多语设置下的配对均在大多数配置下均优于单个模型,同时防止了监督微调的灾难性遗忘。我们观察到,收益需要在策略数据上。离策略响应会削弱该益处,而在线偏好优化未能超过离线变体。在结构化任务上,我们的方法在EuroLLM-9B上达到或超过基线的6/7种语言,在Aya-3B上为4/7种配置。在开放式生成任务中,两个调优模型在11个评估语言中均优于各自的基线。总体而言,我们展示了多语言偏好调优的有前景的方向。
引用
@article{arxiv.2605.26293,
title = {CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations},
author = {Mike Zhang and Ali Basirat and Desmond Elliott},
journal= {arXiv preprint arXiv:2605.26293},
year = {2026}
}