带偏好约束的多样性: 面向学习一组多样的期望技能
机器学习
2023-03-09 v1 人工智能
摘要
在无外在奖励信号的情况下自主学习多样行为一直是强化学习中备受关注的问题。然而,此类机制中的学习本质不受约束,常导致积累若干不可用、不安全或不对齐的技能。为避免此类问题并确保发现安全且符合人类价值观的技能,有必要将人类纳入无监督训练过程,这仍是一个很大程度上未被探索的研究领域。本文提出带偏好约束的多样性(CDP),一种新颖的、协作式人类引导机制,使智能体能学习一组既多样又可取的技能。其核心原则是:将技能的发现限制于那些根据在轨迹对上的人类偏好标签训练得到的偏好模型所判定为可取的区域内。我们在2D导航与Mujoco环境中评估了我们的方法,并展示了发现多样但可取技能的能力。
引用
@article{arxiv.2303.04592,
title = {Controlled Diversity with Preference : Towards Learning a Diverse Set of Desired Skills},
author = {Maxence Hussonnois and Thommen George Karimpanal and Santu Rana},
journal= {arXiv preprint arXiv:2303.04592},
year = {2023}
}
备注
Accepted to AAMAS 2023