中文

解决多目标强化学习中随机环境与局部决策制定问题

机器学习 2022-11-17 v1 人工智能

摘要

多目标强化学习(MORL)是一个相对较新的领域,它在传统强化学习(RL)基础上构建以求解多目标问题。一种常见算法是通过结合捕获用户动作选择偏好的效用函数,使用向量 Q 值扩展标量值 Q-learning。本研究延续先前工作,聚焦于在随机状态转移环境中,当目标是最大化标量化期望回报(SER)——即在多次运行中最大化平均结果而非每次单独回合内的结果——时,哪些因素影响了基于值的 MORL Q-learning 算法学习到环境最优策略的频率。我们分析在不同变体版本下,运行于简单多目标马尔可夫决策过程(MOMDP)空间交易者问题上的随机环境与 MORL Q-learning 算法之间的交互。实证评估表明,设计良好的奖励信号可改善原始基线算法的性能,但仍不足以应对更一般的环境。一种结合全局统计的 MORL Q-Learning 变体在原始空间交易者问题中表现优于基线方法,但在训练结束时寻找所需 SER 最优策略的有效性仍低于 100%。另一方面,选项学习保证收敛到所需的 SER 最优策略,但无法扩展到解决现实生活中的更复杂问题。本论文的主要贡献是明确了在随机环境、非线性效用和恒定学习率三者组合下,噪声 Q 值估计问题对学习能力最优策略的影响程度。

关键词

引用

@article{arxiv.2211.08669,
  title  = {Addressing the issue of stochastic environments and local decision-making in multi-objective reinforcement learning},
  author = {Kewen Ding},
  journal= {arXiv preprint arXiv:2211.08669},
  year   = {2022}
}

备注

55 pages, 21 figures