中文

Democratizing Reward Design for Personal and Representative Value-Alignment

人工智能 2024-10-30 v1 人机交互

摘要

与人类价值观一致的 AI 代理面临的挑战在于多样且主观的价值观观念。标准的对齐方法通常会聚合群众反馈,这可能导致独特或少数偏好被压制。我们引入了交互式反思对话对齐方法,通过不断地让用户反思并指定其主观价值定义来实现这一点。该系统通过基于语言模型的偏好 elicitation 学习个体价值定义,并构建用于对齐 AI 行为的个人化奖励模型。我们通过两个研究评估了该系统,分别涉及30名参与者,其中一个研究侧重“尊重”,另一个研究关注自动驾驶车辆中的伦理决策。我们的发现表明,价值对齐行为的定义具有多样性,并且该系统能够准确捕获每个人的独特理解。这种方法实现了个人化对齐,并可为更具代表性和可解释性的集体对齐策略提供指导。

关键词

引用

@article{arxiv.2410.22203,
  title  = {Democratizing Reward Design for Personal and Representative Value-Alignment},
  author = {Carter Blair and Kate Larson and Edith Law},
  journal= {arXiv preprint arXiv:2410.22203},
  year   = {2024}
}

备注

19 pages, 16 figures