中文

无限时段通用效用马尔可夫决策过程中的试验次数问题

机器学习 2025-07-02 v2

摘要

通用效用马尔可夫决策过程(GUMDPs)框架通过考虑目标函数如何依赖于给定策略引起的状态-动作对访问频率来推广马尔可夫决策过程(MDPs)框架。在本工作中,我们对无限时段GUMDPs中试验次数(即随机抽样轨迹数量)的影响进行了首次分析。我们表明,与标准MDPs不同,试验次数在无限时段GUMDPs中发挥关键作用,给定策略的预期性能通常取决于试验次数。我们考虑折扣型和平均型GUMDPs,其中目标函数分别依赖于折扣型和平均型状态-动作对的访问频率。首先,我们研究折扣型GUMDPs下的策略评估,证明了有限试验次数形式与无限试验次数形式之间差距的下界和上界。其次,我们研究平均型GUMDPs,分析不同类别GUMDPs对有限与无限试验次数形式之间差距的影响。最后,我们提供一组实验结果支持我们的论点,突出试验轨迹数量和底层GUMDP结构对策略评估的影响。

关键词

引用

@article{arxiv.2409.15128,
  title  = {The Number of Trials Matters in Infinite-Horizon General-Utility Markov Decision Processes},
  author = {Pedro P. Santos and Alberto Sardinha and Francisco S. Melo},
  journal= {arXiv preprint arXiv:2409.15128},
  year   = {2025}
}