面对选择异质性的 LLM 对齐:Sign Estimator 方法
人工智能
2025-10-30 v2 机器学习
机器学习
摘要
传统的 LLM 对齐方法容易受到人类偏好差异的影响。对成对比较数据(例如对提示-完成对)采用朴素概率模型,将导致对 population-average utility —— 社会福利的标准度量 —— 估计不一致。我们提出了一种新方法,称为 sign estimator,通过替换聚合步骤中的交叉熵为二元分类损失,提供一个简单、可一致且高效的估计器。这种简单的修改在温和假设下恢复了一致的序对齐,并实现了该setting 下首次的多项式有限样本误差界。在使用数字分身进行 LLM 对齐的真实情景模拟中,sign estimator 在一组模拟人物中显著减少了偏好失真,将(角度)估计误差降低约 35%,将与真实 population 偏好不一致的比例从 12% 降至 8%。我们的方法还与需要跟踪 individual-level 偏好数据的 panel data 启发式方法相当,同时保持了现有 LLM 对齐管道的实现简单性。
关键词
引用
@article{arxiv.2510.23965,
title = {The Sign Estimator: LLM Alignment in the Face of Choice Heterogeneity},
author = {Ali Aouad and Aymane El Gadarri and Vivek F. Farias},
journal= {arXiv preprint arXiv:2510.23965},
year = {2025}
}