中文

基于凸性信息的深度强化学习求解信念MDP

机器学习 2025-03-13 v2

摘要

我们提出了一种新的深度强化学习方法,融合了信念空间价值函数凸性特性,用于部分可观测马尔可夫决策过程(POMDPs)。我们引入硬性和软性凸性约束两种不同的实现方式,并将其性能与标准深度强化学习方法在两个著名的POMDP环境(Tiger 和 FieldVisionRockSample)上进行比较。我们的发现表明,纳入凸性特征可显著提升智能体的性能,以及在超出分布域的测试中提高鲁棒性,尤其是在面对超参数空间时。该工作的源代码可在 https://github.com/Dakout/Convex_DRL 获取。

关键词

引用

@article{arxiv.2502.09298,
  title  = {Convex Is Back: Solving Belief MDPs With Convexity-Informed Deep Reinforcement Learning},
  author = {Daniel Koutas and Daniel Hettegger and Kostas G. Papakonstantinou and Daniel Straub},
  journal= {arXiv preprint arXiv:2502.09298},
  year   = {2025}
}