MACPO:通过多智能体对抗性偏好优化实现弱到强的对齐
计算与语言
2025-03-04 v2 人工智能
摘要
随着大语言模型(Large Language Models, LLMs)的快速发展并在特定任务上接近人类水平,与人类价值观一致化正变得越来越紧迫。在LLM性能超过人类的场景中,我们面临需要通过弱监督(由弱教师生成)来有效对齐强学生LLM的弱到强对齐问题。现有的对齐方法主要关注强到弱的对齐和自对齐设置,不切实可行地适应更困难的弱到强对齐环境。为填补这一空白,我们提出了多智能体对抗性偏好优化(Multi-Agent Contrastive Preference Optimization, MACPO)框架。MACPO通过迭代加强不熟悉的正面行为,同时惩罚熟悉的负面行为,促进弱教师和强学生相互学习。为实现这一目标,我们设计了互惠正面行为增强策略,以鼓励弱教师和强学生从彼此的正面行为中学习,并进一步为下一轮迭代提供更高质量的正面行为。此外,我们提出了困难负面行为构建策略,通过在负面行为数据上微调来诱导弱教师和强学生生成熟悉的负面行为。在HH-RLHF和PKU-SafeRLHF数据集上的实验结果,通过自动评估指标和人类判断,表明MACPO同时提高了强学生和弱教师的对齐性能。此外,随着弱教师数量的增加,MACPO通过更多的迭代优化轮次实现更好的弱到强对齐性能。
引用
@article{arxiv.2410.07672,
title = {MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization},
author = {Yougang Lyu and Lingyong Yan and Zihan Wang and Dawei Yin and Pengjie Ren and Maarten de Rijke and Zhaochun Ren},
journal= {arXiv preprint arXiv:2410.07672},
year = {2025}
}
备注
ICLR 2025