超越妥协:帕累托宽容共识用于高效的多偏好LLM对齐
人工智能
2026-04-08 v1
摘要
超越单偏好范式,将LLM与多样化的人类价值观对齐对于鲁棒部署至关重要。当代多目标偏好对齐(MPA)方法主要依赖静态线性标量化或刚性梯度投影来导航这些权衡。然而,通过强制严格冲突避免或同步下降,这些范式往往过早收敛到局部驻点。虽然在数学上稳定,但这些点代表了一种保守的妥协,模型为避免瞬态局部权衡而牺牲了潜在的帕累托全局改进。为了打破这一僵局,我们提出了帕累托宽容共识(PLC),一个将对齐重新构想为动态谈判过程的博弈论框架。与刚性方法不同,PLC引入了基于共识的宽容梯度校正,在存在足够主导联盟盈余的情况下动态容忍局部退化,从而赋予优化轨迹以逃离局部次优均衡并探索远端帕累托最优前沿的能力。理论分析验证了PLC可以促进僵局逃脱并渐近收敛到帕累托共识均衡。此外,大量实验表明PLC在固定偏好对齐和全局帕累托前沿质量方面均超越了基线。本工作突显了谈判驱动对齐作为MPA有前景的新方向。我们的代码可在 https://anonymous.4open.science/r/aaa-6BB8 获取。
引用
@article{arxiv.2604.05965,
title = {Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM Alignment},
author = {Renxuan Tan and Rongpeng Li and Zhifeng Zhao and Honggang Zhang},
journal= {arXiv preprint arXiv:2604.05965},
year = {2026}
}