中文

面向多元对齐的反思性言语奖励设计

人工智能 2025-06-24 v1 人机交互

摘要

AI 智能体通常通过人类反馈强化学习(RLHF)与“人类价值观”对齐,该方法从聚合的人类反馈中学习单一奖励模型,并用于对齐智能体的行为。然而,人类价值观并非同质——不同的人持有不同且有时相互冲突的价值观。将反馈聚合为单一奖励模型会带来不成比例地压制少数群体偏好的风险。为了解决这个问题,我们提出了一种新颖的奖励建模方法,用于学习个性化奖励模型。该方法使用语言模型引导用户进行反思性对话,在对话中用户对智能体行为进行批评并构建其偏好。这段包含用户反思和批评示例的个性化对话历史,随后被用作另一个语言模型的上下文,该语言模型充当个性化奖励函数(我们称之为“言语奖励模型”)以评估新的轨迹。在 30 名参与者的研究中,与传统监督学习方法相比,我们的方法比非反思性言语奖励模型的准确率提高了 9-12%,同时具有更高的样本效率。

关键词

引用

@article{arxiv.2506.17834,
  title  = {Reflective Verbal Reward Design for Pluralistic Alignment},
  author = {Carter Blair and Kate Larson and Edith Law},
  journal= {arXiv preprint arXiv:2506.17834},
  year   = {2025}
}

备注

9 pages, 3 figures, accepted to the IJCAI 2025 Human-Centred AI track. Project repository at: https://osf.io/8yxf2/