序列随机控制(单智能体或多智能体)问题近乎容许带独立测量的测度变换
最优化与控制
2022-01-20 v2
摘要
测度变换一直是随机控制与分析中的有效方法;在连续时间控制中,这遵循应用于完全观测与部分观测模型的吉萨诺夫定理,在分散随机控制(或随机动态团队理论)中这被称为维森豪森静态约化,而在离散时间经典随机控制中,博卡尔将该方法用于部分观测马尔可夫决策过程(POMDP),推广了弗莱明和帕尔杜在连续时间中的方法。该方法允许在 new 概率空间中实现等价的优随机控制或滤波,其中测量在离散时间与连续时间均构成独立外生过程,并且(真实测度与由独立测量过程形成的参考测度之间的)拉东–尼科迪姆导数被推到代价或动态中。然而,其适用需要绝对连续性条件。这引出以下问题:我们能否通过对测量加入任意小的加性(如高斯或其他)噪声来扰动任意离散时间序列随机控制问题,使系统测量绝对连续,从而可以以最优代价中任意小的误差应用测度变换(或静态约化)?亦即,就最优代价而言,是否所有序列随机(单智能体或分散多智能体)问题都距静态可约化相差 ,对任意 ?我们证明当代价函数在控制动作上连续有界且动作空间为凸时这是可能的。我们还注意到,扰动系统所得的解与代价对原模型是(在随机化策略下)可实现的。
引用
@article{arxiv.2111.15120,
title = {Sequential Stochastic Control (Single or Multi-Agent) Problems Nearly Admit Change of Measures with Independent Measurements},
author = {Ian Hogeboom-Burr and Serdar Yüksel},
journal= {arXiv preprint arXiv:2111.15120},
year = {2022}
}
备注
17 pages, 1 figure