AlignDiff:通过行为可定制扩散模型对齐多样化人类偏好
人工智能
2024-02-06 v2
摘要
由于人类偏好固有的抽象性与易变性,将智能体行为对齐多样化人类偏好在强化学习(RL)中仍具挑战。为解决这些问题,我们提出AlignDiff,一种新颖的框架,其利用基于人类反馈的强化学习(RLHF)量化人类偏好(涵盖抽象性),并用其引导扩散规划以实现零样本行为定制(涵盖易变性)。AlignDiff能准确匹配用户定制行为,并高效地在行为间切换。为构建该框架,我们首先建立多视角人类反馈数据集,包含对多样化行为属性的比较,随后训练属性强度模型以预测量化的相对强度。在用相对强度重标行为数据集后,我们进一步训练属性条件扩散模型,该模型作为规划器,在推理阶段以属性强度模型为引导器实现对齐偏好。我们在多种运动任务上评估AlignDiff,并证明其在偏好匹配、切换与覆盖上相较其他基线具有优越性能。其在人类指令下完成未见下游任务的能力也展示了人机协作的广阔潜力。更多可视化视频发布于 https://aligndiff.github.io/。
引用
@article{arxiv.2310.02054,
title = {AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model},
author = {Zibin Dong and Yifu Yuan and Jianye Hao and Fei Ni and Yao Mu and Yan Zheng and Yujing Hu and Tangjie Lv and Changjie Fan and Zhipeng Hu},
journal= {arXiv preprint arXiv:2310.02054},
year = {2024}
}