随机环境下基于值的多目标强化学习的实证研究
机器学习
2024-01-09 v1
摘要
解决多目标强化学习(MORL)问题的一种常见方法是扩展传统的 Q-learning,使用向量 Q 值结合效用函数。然而,在随机环境的背景下,特别是在优化标量化期望回报(SER)准则时,这种方法可能会出现问题。本文扩展了先前的研究,详细考察了影响基于值的 MORL Q-learning 算法在具有随机状态转移的环境中学习到 SER 最优策略频率的因素。我们实证检验了核心多目标 Q-learning 算法的几种变体以及奖励工程方法,并展示了这些方法的局限性。特别是,我们强调了噪声 Q 值估计问题对这些算法稳定性和收敛性的关键影响。
引用
@article{arxiv.2401.03163,
title = {An Empirical Investigation of Value-Based Multi-objective Reinforcement Learning for Stochastic Environments},
author = {Kewen Ding and Peter Vamplew and Cameron Foale and Richard Dazeley},
journal= {arXiv preprint arXiv:2401.03163},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2211.08669