两种 RLHF 目标何时相等?
机器学习
2026-02-06 v2 人工智能
计算与语言
摘要
偏好优化文献中提出了许多目标函数,常被呈现为不同的改进。我们引入 Opal,这是一种规范化算法,通过生成规范形式或具体的非等价见证来确定两种偏好目标是否在代数上等价。应用 Opal 揭示了许多广泛使用的方法实际上优化的是相同的底层目标,而另一些则是 provably 不同的。例如,批量归一化会导致相同响应对在批次组成不同时接收不同的梯度。我们识别出一小组产生真正不同目标的结构机制;其余大多数差异仅是参数化重构。
引用
@article{arxiv.2509.11298,
title = {When Are Two RLHF Objectives the Same?},
author = {Madhava Gaikwad},
journal= {arXiv preprint arXiv:2509.11298},
year = {2026}
}
备注
21 pages