可引导的多元主义:通过少样本比较回归实现多元对齐
计算与语言
2025-08-13 v1 人工智能
摘要
当前,大语言模型(LLMs)通过诸如基于人类反馈的强化学习(RLHF)等技术进行对齐。然而,这些方法使用标量奖励,只能反映用户的平均偏好。多元对齐则试图捕捉用户在一系列属性上的多样化偏好,超越单纯的帮助性和无害性。为此,我们提出了一种基于少样本比较回归的可引导多元模型,该模型能够适应个体用户的偏好。我们的方法利用上下文学习和推理,基于一组细粒度属性,来比较响应选项并做出对齐的选择。为了评估我们的算法,我们还通过改编道德完整性语料库(MIC)和HelpSteer2数据集,提出了两个新的可引导多元基准,分别展示了我们的方法在价值对齐决策和奖励建模中的适用性。我们的少样本比较回归方法具有可解释性,并且与不同的属性和大语言模型兼容,同时性能优于多种基线和最先进的方法。我们的工作为多元对齐提供了新的见解和研究方向,促进了大语言模型更公平、更具代表性的使用,并推动了伦理人工智能领域的最新技术发展。
引用
@article{arxiv.2508.08509,
title = {Steerable Pluralism: Pluralistic Alignment via Few-Shot Comparative Regression},
author = {Jadie Adams and Brian Hu and Emily Veenhuis and David Joy and Bharadwaj Ravichandran and Aaron Bray and Anthony Hoogs and Arslan Basharat},
journal= {arXiv preprint arXiv:2508.08509},
year = {2025}
}
备注
AIES '25: Proceedings of the 2025 AAAI/ACM Conference on AI, Ethics, and Society