面向单试验场景下的通用效用马尔可夫决策过程的在线规划求解
机器学习
2026-02-10 v2
摘要
在本工作中,我们首次提出一种方法,用于在单试验情景下求解无限时刻折扣型通用效用马尔可夫决策过程(GUMDPs),即代理人的表现基于单个轨迹进行评估。首先,我们提供了关于单试验情景下策略优化的一些基本结果,探讨了哪些策略类别足以实现最优性,将问题建模为一个等价于原问题的特定MDP,以及研究了在单试验情景下进行策略优化的计算难度。其次,我们展示如何利用在线规划技术,特别是蒙特卡洛树搜索算法,在单试验情景下求解GUMDP。最后,我们提供了实验结果,展示了我们方法相对于相关基线的优异性能。
引用
@article{arxiv.2505.15782,
title = {Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning},
author = {Pedro P. Santos and Alberto Sardinha and Francisco S. Melo},
journal= {arXiv preprint arXiv:2505.15782},
year = {2026}
}