中文

通过因果解耦提升蒙特卡洛规划:面向结构分解马尔可夫决策过程

人工智能 2025-10-06 v2 机器学习 系统与控制 系统与控制

摘要

马尔可夫决策过程(MDP)作为通用框架,往往忽视了利用其转换和奖励动态因果结构所带来的优势。对于资源分配问题的一个子类,我们引入了结构分解马尔可夫决策过程(SD-MDP),通过因果解耦将MDP的时序因果图划分为独立组件。凭借这种解耦,SD-MDP实现了维度压缩和在最优值函数估计中的计算效率提升。我们将顺序优化问题简化为具有对数线性复杂度的分数背包问题 O(TlogT)O(T \log T),超越具有对时间范围 TT 多项式复杂度的传统随机规划方法。此外,SD-MDP的计算优势与状态-动作空间大小无关,因而适用于高维空间。进一步地,我们的方法无缝集成到蒙特卡洛树搜索(MCTS)中,实现了在受限模拟预算下获得更高的预期奖励,并提供了消失的简单后悔界。实证结果表明,在各种物流和金融领域中,SD-MDP的方法在多个基准测试中表现出优异的政策性能。

关键词

引用

@article{arxiv.2406.16151,
  title  = {Improved Monte Carlo Planning via Causal Disentanglement for Structurally-Decomposed Markov Decision Processes},
  author = {Larkin Liu and Shiqi Liu and Yinruo Hua and Matej Jusup},
  journal= {arXiv preprint arXiv:2406.16151},
  year   = {2025}
}

备注

Conference Paper. 7th International Conference on Distributed Artificial Intelligence (DAI)