中文

Pareto逆强化学习:用于多样化专家策略生成

机器学习 2024-08-23 v1

摘要

数据驱动的离线强化学习和模仿学习方法正在变得越来越流行,以解决顺序决策问题。然而,这些方法很少考虑从有限的专家数据集中学习Pareto最优策略。这在实际中尤其突出,因为获取全面的数据集以覆盖所有偏好存在限制,而这些数据集涉及多个相互冲突的目标,而每个专家可能对这些目标持有独特的优化偏好。本文通过使用奖励距离估计来正则化判别器,适应逆强化学习(IRL)。这使得能够仅使用两个具有不同专家偏好的数据集,逐渐生成一组能够容纳多目标下多样化偏好的策略。通过这种方式,我们提出了一种Pareto IRL框架(ParIRL),该框架从这些有限的数据集中建立Pareto策略集合。在该框架中,Pareto策略集合随后被蒸馏为一个单一的、条件于偏好的扩散模型,从而允许用户立即指定他们更倾向于哪位专家的模式。通过实验,我们展示ParIRL在各种多目标控制任务中优于其他IRL算法,实现了对Pareto前沿的稠密近似。我们还展示了ParIRL在CARLA中的自主驾驶应用的可行性。

关键词

引用

@article{arxiv.2408.12110,
  title  = {Pareto Inverse Reinforcement Learning for Diverse Expert Policy Generation},
  author = {Woo Kyung Kim and Minjong Yoo and Honguk Woo},
  journal= {arXiv preprint arXiv:2408.12110},
  year   = {2024}
}

备注

13 pages, 7 figures; Accepted for International Joint Conference on Artificial Intelligence (IJCAI) 2024; Published version