中文

随机状态转移下基于价值的多目标强化学习问题的演示

机器学习 2021-03-16 v1 多智能体系统 机器学习

摘要

我们报告了在具有随机状态转移的环境中,无模型、基于价值的多目标强化学习方法此前未被识别出的一个问题。通过一个示例多目标马尔可夫决策过程(MOMDP)表明,在此类条件下这些方法可能无法发现使标量期望回报最大化的策略,事实上可能收敛到被帕累托占优的解。我们讨论了若干替代方法,其可能更适合在具有随机转移的 MOMDP 中最大化 SER(标量期望回报)。

关键词

引用

@article{arxiv.2004.06277,
  title  = {A Demonstration of Issues with Value-Based Multiobjective Reinforcement Learning Under Stochastic State Transitions},
  author = {Peter Vamplew and Cameron Foale and Richard Dazeley},
  journal= {arXiv preprint arXiv:2004.06277},
  year   = {2021}
}

备注

6 pages. Accepted for presentation in the Adaptive and Learning Agents Workshop, AAMAS 2020