面向克隆稳健的 AI 对齐
机器学习
2025-01-17 v1 人工智能
计算机科学与博弈论
摘要
训练大型语言模型(LLM)的一个关键挑战是正确地将其与人类偏好相匹配。强化学习人类反馈(RLHF)使用人类标注员的成对比较来训练奖励函数,已成为一种流行的对齐方法。然而,RLHF 中的输入数据集可能在问题和答案的类型分布上并不均衡。因此,我们希望 RLHF 算法即使在备选方案集合并非均匀分布时也能表现良好。基于社会选择论的见解,我们引入了对近似克隆的鲁棒性,这是一种理想的 RLHF 算法属性,要求在添加近似重复备选方案后,所学奖励函数的变化不会显著。我们首先演示了基于正则化最大似然估计(MLE)的标准 RLHF 算法无法满足这一属性。随后,我们提出了加权 MLE 方法,这是一种新的 RLHF 算法,通过对备选方案根据其与其他备选方案的相似性进行加权来修改标准正则化 MLE。该新算法在保证对近似克隆鲁棒性的同时,保留了令人满意的理论属性。
引用
@article{arxiv.2501.09254,
title = {Clone-Robust AI Alignment},
author = {Ariel D. Procaccia and Benjamin Schiffer and Shirley Zhang},
journal= {arXiv preprint arXiv:2501.09254},
year = {2025}
}