通过因果解耦提升蒙特卡洛规划:面向结构分解马尔可夫决策过程
人工智能
2025-10-06 v2 机器学习
系统与控制
系统与控制
摘要
马尔可夫决策过程(MDP)作为通用框架,往往忽视了利用其转换和奖励动态因果结构所带来的优势。对于资源分配问题的一个子类,我们引入了结构分解马尔可夫决策过程(SD-MDP),通过因果解耦将MDP的时序因果图划分为独立组件。凭借这种解耦,SD-MDP实现了维度压缩和在最优值函数估计中的计算效率提升。我们将顺序优化问题简化为具有对数线性复杂度的分数背包问题 ,超越具有对时间范围 多项式复杂度的传统随机规划方法。此外,SD-MDP的计算优势与状态-动作空间大小无关,因而适用于高维空间。进一步地,我们的方法无缝集成到蒙特卡洛树搜索(MCTS)中,实现了在受限模拟预算下获得更高的预期奖励,并提供了消失的简单后悔界。实证结果表明,在各种物流和金融领域中,SD-MDP的方法在多个基准测试中表现出优异的政策性能。
引用
@article{arxiv.2406.16151,
title = {Improved Monte Carlo Planning via Causal Disentanglement for Structurally-Decomposed Markov Decision Processes},
author = {Larkin Liu and Shiqi Liu and Yinruo Hua and Matej Jusup},
journal= {arXiv preprint arXiv:2406.16151},
year = {2025}
}
备注
Conference Paper. 7th International Conference on Distributed Artificial Intelligence (DAI)