基于优化的区间 MDP 的鲁棒许可合成
机器人学
2026-03-17 v2 系统与控制
系统与控制
摘要
我们提出了一种针对区间马尔可夫决策过程(IMDP)的优化驱动的鲁棒许可合成框架,灵感来自于在转换不确定性下进行机器人决策。在许多机器人系统中,模型不准确和感知噪声导致区间型转换概率。在传统的鲁棒 IMDP 合成中通常仅产生单个策略,而许可合成则假设模型精确,我们展示在区间不确定性下的鲁棒许可合成可建模为一个全局混合整数线性规划(MILP),直接编码鲁棒 Bellman 约束。该公式最大化量化许可度指标(启用的状态-动作对数量),同时保证每种符合策略在所有可接受的转换实现下满足概率可达性或预期奖励规范。为了解决基于顶点的不确定性表示的指数级复杂度,我们推导出基于对偶分解的编码,消除显式顶点枚举并随后继数量线性扩展。实验评估在四个代表性机器人基准域中表明,对拥有数十万状态的 IMDP 实现了可扩展性。该框架为不确定性感知、保持灵活性的机器人控制合成提供了实用且通用的基础。
引用
@article{arxiv.2510.03481,
title = {Optimization-Based Robust Permissive Synthesis for Interval MDPs},
author = {Khang Vo Huynh and David Parker and Lu Feng},
journal= {arXiv preprint arXiv:2510.03481},
year = {2026}
}