什么是人类价值观,我们如何使AI与之对齐?
计算机与社会
2024-04-18 v2 人工智能
计算与语言
人机交互
机器学习
摘要
人们逐渐达成共识,我们需要使AI系统与人类价值观对齐(Gabriel, 2020; Ji et al., 2024),但如何将其应用于语言模型在实践中仍不清楚。我们将“与人类价值观对齐”的问题分为三个部分:首先,从人们那里引出价值观;其次,将这些价值观调和成一个用于训练机器学习模型的对齐目标;第三,实际训练模型。在本文中,我们专注于前两部分,并问:什么是将关于价值观的多样化人类输入综合成语言模型对齐目标的“好”方法?为了回答这个问题,我们首先定义了一组6个标准,我们认为对齐目标必须满足这些标准,才能使模型行为符合人类价值观。然后,我们提出了一种称为道德图启发(MGE)的引出和调和价值观的过程,它使用大型语言模型在特定背景下采访参与者关于他们的价值观;我们的方法受到Taylor(1977)、Chang(2004)等人提出的价值观哲学的启发。我们在500名美国人的代表性样本上试验了MGE,使用了3个故意引起争议的提示(例如关于堕胎的建议)。我们的结果表明,MGE在改善所有6个标准的模型对齐方面很有前景。例如,几乎所有参与者(89.1%)都感到被该过程很好地代表,并且(89%)认为最终的道德图是公平的,即使他们的价值观没有被投票为最明智的。我们的过程通常会导致“专家”价值观(例如,来自寻求过堕胎建议的女性的价值观)上升到道德图的顶部,而无需事先定义谁是专家。
引用
@article{arxiv.2404.10636,
title = {What are human values, and how do we align AI to them?},
author = {Oliver Klingefjord and Ryan Lowe and Joe Edelman},
journal= {arXiv preprint arXiv:2404.10636},
year = {2024}
}