中文

PD-MORL:偏好驱动的多目标强化学习算法

机器学习 2023-05-31 v3 人工智能

摘要

多目标强化学习(MORL)方法已经出现,用于通过最大化由偏好向量加权的联合目标函数来解决许多具有多个冲突目标的现实世界问题。这些方法找到与训练期间指定的偏好向量相对应的固定定制化策略。然而,设计约束和目标在现实场景中通常是动态变化的。此外,为每个潜在偏好存储一个策略是不可扩展的。因此,在给定领域中通过单次训练获得整个偏好空间的一组帕累托前沿解至关重要。为此,我们提出了一种新颖的 MORL 算法,训练单个通用网络以覆盖整个偏好空间,并可扩展到连续机器人任务。所提出的方法,偏好驱动 MORL(PD-MORL),利用偏好作为指导来更新网络参数。它还采用一种新颖的并行化方法来提高样本效率。我们表明,PD-MORL 在具有挑战性的连续控制任务上实现了高达 25% 更大的超体积,并且与先前方法相比使用的可训练参数少一个数量级。

关键词

引用

@article{arxiv.2208.07914,
  title  = {PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning Algorithm},
  author = {Toygun Basaklar and Suat Gumussoy and Umit Y. Ogras},
  journal= {arXiv preprint arXiv:2208.07914},
  year   = {2023}
}

备注

24 pages, 8 Figures, 9 Tables, Published as a conference paper at ICLR 2023, https://openreview.net/forum?id=zS9sRyaPFlJ