中文

相对行为属性:填补符号目标设定与基于人类偏好奖励学习之间的鸿沟

人工智能 2023-03-01 v4 人机交互 机器学习

摘要

生成满足非专家用户偏好的复杂行为是 AI 智能体的关键需求。基于轨迹比较的交互式奖励学习(即 RLHF)是一种让非专家用户通过对智能体行为的短片段表达偏好来传达复杂目标的方式。尽管这种参数化方法能编码底层任务中存在的复杂默会知识,但它隐含假设人类无法提供比二元偏好标签更丰富的反馈,导致反馈复杂度高得难以忍受且用户体验差。虽然提供目标的详细符号闭式规范可能诱人,但即便对专家用户也未必可行。然而在大多数情况下,人类即便无法以符号完全指定任务目标,也清楚智能体应沿有意义维度如何改变其行为以达成其潜在目的。受此启发,我们引入相对行为属性 (Relative Behavioral Attributes) 的概念,允许用户通过符号概念(如增加智能体运动的柔和度或速度)来调整智能体行为。我们提出两种实用方法,能够从有序行为片段中学习建模任意类型的行为属性。我们在四个任务、九种不同行为属性上展示了方法的有效性,表明一旦属性被学习,终端用户仅需约十次反馈即可相对轻松地产生期望的智能体行为。这比流行的人类偏好学习基线所需反馈量少了一个数量级以上。补充视频与源代码可见于:https://guansuns.github.io/pages/rba。

关键词

引用

@article{arxiv.2210.15906,
  title  = {Relative Behavioral Attributes: Filling the Gap between Symbolic Goal Specification and Reward Learning from Human Preferences},
  author = {Lin Guan and Karthik Valmeekam and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:2210.15906},
  year   = {2023}
}

备注

ICLR 2023 Camera Ready