基于凸性信息的深度强化学习求解信念MDP
机器学习
2025-03-13 v2
摘要
我们提出了一种新的深度强化学习方法,融合了信念空间价值函数凸性特性,用于部分可观测马尔可夫决策过程(POMDPs)。我们引入硬性和软性凸性约束两种不同的实现方式,并将其性能与标准深度强化学习方法在两个著名的POMDP环境(Tiger 和 FieldVisionRockSample)上进行比较。我们的发现表明,纳入凸性特征可显著提升智能体的性能,以及在超出分布域的测试中提高鲁棒性,尤其是在面对超参数空间时。该工作的源代码可在 https://github.com/Dakout/Convex_DRL 获取。
引用
@article{arxiv.2502.09298,
title = {Convex Is Back: Solving Belief MDPs With Convexity-Informed Deep Reinforcement Learning},
author = {Daniel Koutas and Daniel Hettegger and Kostas G. Papakonstantinou and Daniel Straub},
journal= {arXiv preprint arXiv:2502.09298},
year = {2025}
}