SPARTA ALIGNMENT:通过战斗集体对齐多个语言模型
计算与语言
2025-11-04 v3
摘要
我们提出 SPARTA ALIGNMENT 算法,通过竞争和战斗对齐多个大语言模型。为弥补单一模型在生成多样性和评估偏见方面的不足,多个 LLM 以“斯巴达部落”形式相互竞争,同时作为他人竞争的评判员。在每一轮中,选取一个指令和两个模型进行决斗,其他模型对两个响应进行评估,其评估得分通过适应性的 elo 排名制度聚合,其中胜者/败者在评估他人时获得/失去权重。然后,战斗的结果转化为偏好对,其中获胜的响应优于失败的响应,所有模型最终在每轮结束时从这些偏好中学习。SPARTA ALIGNMENT 实现了多个 LLM 在迭代和集体竞争过程中自我演化。大量实验表明,SPARTA ALIGNMENT 在 12 个任务和数据集中的 10 个上显著优于初始模型和 4 个自对齐基线,平均提升 7.0%。进一步分析显示,SPARTA ALIGNMENT 对未见任务具有更好的泛化能力,并利用参与模型的专长多样性产生更具逻辑性、直接性和信息性的输出。
引用
@article{arxiv.2506.04721,
title = {SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat},
author = {Yuru Jiang and Wenxuan Ding and Shangbin Feng and Greg Durrett and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2506.04721},
year = {2025}
}
备注
NeurIPS 2025