中文

基于世界模型与在线黎曼优化的安全关键上下文控制

系统与控制 2026-04-22 v1 人工智能 系统与控制

摘要

现代世界模型正变得过于复杂,难以获得显式的动力学描述。我们研究安全关键上下文控制,其中规划器必须仅使用来自黑盒模拟器的可行性样本,在上下文信号 ξt\xi_t 的条件下优化任务目标。我们开发了一个基于在线黎曼优化的样本化惩罚预测控制(PPC)框架,其中模拟器将可行流形压缩为基于分数的密度 p^(uξt)\hat{p}(u \mid \xi_t),该密度赋予动作空间以黎曼几何,从而引导规划器的梯度下降。势垒曲率 κ(ξt)\kappa(\xi_t),即条件对数密度 lnp^(ξt)-\ln\hat{p}(\cdot\mid\xi_t) 的最小曲率,控制着收敛速率和安全裕度,取代了未知动力学的 Lipschitz 常数。我们的主要结果是上下文安全界限,表明与真实可行流形的距离由分数估计误差和一个依赖于 κ(ξt)\kappa(\xi_t) 的比率控制,两者均随上下文信息的丰富而改善。在动态导航任务上的仿真证实,上下文 PPC 显著优于边缘密度模型和冻结密度模型,且在环境变化后优势不断扩大。

关键词

引用

@article{arxiv.2604.19639,
  title  = {Safety-Critical Contextual Control via Online Riemannian Optimization with World Models},
  author = {Tongxin Li},
  journal= {arXiv preprint arXiv:2604.19639},
  year   = {2026}
}

备注

20 pages, 12 figures