通过离线多目标强化学习扩展帕累托高效决策
机器学习
2023-05-02 v1 人工智能
摘要
多目标强化学习(MORL)的目标是学习同时优化多个竞争目标的策略。在实践中,智能体对目标的偏好可能无法事先知晓,因此我们需要能够在测试时泛化到任意偏好的策略。在本工作中,我们提出一种用于离线MORL的新数据驱动设定,其中我们希望仅使用有限的其他智能体及其偏好的离线演示数据集来学习偏好不可知策略智能体。本工作的关键贡献有两点。首先,我们引入D4MORL,即专为离线设定设计的(D)atasets for MORL。它包含在6个MuJoCo环境上通过滚动优化随机采样偏好的参考策略获得的有180万带标注演示,每个环境有2-3个目标。其次,我们提出帕累托高效决策智能体(PEDA),一类离线MORL算法,其通过新颖的偏好与回报条件策略构建并扩展Decision Transformers。经验上,我们表明PEDA在D4MORL基准上紧密近似行为策略,并通过适当条件化提供帕累托前沿的优异近似,这由超体积和稀疏性度量衡量。
引用
@article{arxiv.2305.00567,
title = {Scaling Pareto-Efficient Decision Making Via Offline Multi-Objective RL},
author = {Baiting Zhu and Meihua Dang and Aditya Grover},
journal= {arXiv preprint arXiv:2305.00567},
year = {2023}
}
备注
Published in ICLR 2023