随机状态转移下基于价值的多目标强化学习问题的演示
机器学习
2021-03-16 v1 多智能体系统
机器学习
摘要
我们报告了在具有随机状态转移的环境中,无模型、基于价值的多目标强化学习方法此前未被识别出的一个问题。通过一个示例多目标马尔可夫决策过程(MOMDP)表明,在此类条件下这些方法可能无法发现使标量期望回报最大化的策略,事实上可能收敛到被帕累托占优的解。我们讨论了若干替代方法,其可能更适合在具有随机转移的 MOMDP 中最大化 SER(标量期望回报)。
引用
@article{arxiv.2004.06277,
title = {A Demonstration of Issues with Value-Based Multiobjective Reinforcement Learning Under Stochastic State Transitions},
author = {Peter Vamplew and Cameron Foale and Richard Dazeley},
journal= {arXiv preprint arXiv:2004.06277},
year = {2021}
}
备注
6 pages. Accepted for presentation in the Adaptive and Learning Agents Workshop, AAMAS 2020