中文

通过排序加权RLHF实现民主化偏好对齐

人工智能 2026-02-06 v1 机器学习

摘要

AI系统应学习哪些价值观?基于偏好的方法如RLHF从人类评委那里获取训练信号,但这些评委池通常是便利抽样,系统性地过度代表某些人口统计特征,而不足代表其他特征。我们提出了民主化偏好优化(Democratic Preference Optimization, DemPO)框架,将算法化的抽样机制——即用于构建公民议会的同一机制——应用于基于偏好的微调。DemPO提供两种训练方案。硬性面板(Hard Panel)仅使用来自通过抽样机制进行配额抽样的小型公众样本的偏好。软性面板(Soft Panel)保留所有数据,但根据抽样彩票中每个评委的包含概率对其进行重新加权。我们证明了软性面板的加权在闭式形式下恢复了硬性面板目标的期望值。使用包含人类判断与评委人口统计特征配对的公共偏好数据集,以及独立从代表性美国小组中抽取的七十五条宪法,我们评估了从一十亿到八十亿参数的Llama模型在每种方案下进行微调后的模型。对于六种聚合方法,硬性面板始终位居第一,软性面板始终优于未加权基线,其效应规模随模型容量的增加而增大。这些结果表明,在偏好收集阶段强制实现人口统计特征代表性,而非事后纠正,能够得到更能反映来自代表性公众的价值观的模型行为。

关键词

引用

@article{arxiv.2602.05113,
  title  = {Democratic Preference Alignment via Sortition-Weighted RLHF},
  author = {Suvadip Sana and Jinzhou Wu and Martin T. Wells},
  journal= {arXiv preprint arXiv:2602.05113},
  year   = {2026}
}

备注

16 pages, 5 figures