中文

第三种类型的马尔可夫决策过程:基于策略梯度下降学习分布

计算机视觉与模式识别 2026-02-11 v2 人工智能 计算与语言

摘要

本文旨在分析作为控制问题的分布式马尔可夫决策过程(MDP),其中目标是学习能够将累积奖励的分布引导至指定目标律的政策,而非优化期望值或风险功能。在无模型的设置下求解 resulting distributional control problem,我们提出一种基于神经网络参数化的政策梯度算法,用于定义在增广状态空间上的随机化马尔可夫政策,并基于样本的特征函数损失进行评估。在 mild regularity and growth assumptions 下,我们使用随机逼近技术证明了该算法收敛于平稳点。若干数值实验说明了该方法能够匹配复杂的目标分布、恢复当存在时经典的最优政策,并揭示了分布式控制特有的内在非唯一性现象。

关键词

引用

@article{arxiv.2602.06566,
  title  = {SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs},
  author = {Niccolo Avogaro and Nayanika Debnath and Li Mi and Thomas Frick and Junling Wang and Zexue He and Hang Hua and Konrad Schindler and Mattia Rigotti},
  journal= {arXiv preprint arXiv:2602.06566},
  year   = {2026}
}