演示引导的多目标强化学习
机器学习
2024-04-08 v1 人工智能
摘要
多目标强化学习(MORL)因其类似于需要在多个目标之间进行权衡的现实场景而日益重要。传统强化学习在MORL中面临的挑战因满足多样化用户偏好而被放大。为解决从头训练MORL策略的困难问题,本文引入了演示引导的多目标强化学习(DG-MORL)。这种新方法利用先前演示,通过角落权重支持将其与用户偏好对齐,并纳入自我演化机制以细化次优演示。我们的实证研究表明,DG-MORL的优于现有MORL算法,证明了其稳健性和有效性,特别是在面对具有挑战性条件时。我们还提供了该算法样本复杂度的上界。
引用
@article{arxiv.2404.03997,
title = {Demonstration Guided Multi-Objective Reinforcement Learning},
author = {Junlin Lu and Patrick Mannion and Karl Mason},
journal= {arXiv preprint arXiv:2404.03997},
year = {2024}
}