中文

ELVIS:面向长时程视觉 MPC 的集成校准隐式想象

机器学习 2026-05-07 v1 机器人学 系统与控制 系统与控制

摘要

基于模型的强化学习(RL)在视觉控制中的核心挑战是可靠的长时程规划:使用学习到的隐式动力学进行的长时程展开会表现出分叉的未来和多模态的动作-价值分布。此外,视觉遮挡放大的复合模型误差使得深度想象变得脆弱。我们提出了 ELVIS,一种旨在使长时程规划切实可行的隐式模型预测控制器(MPC)。ELVIS 在 Dreamer 风格的循环状态空间模型(RSSM)中进行规划,并用高斯混合 MPPI 替代标准的单模态模型预测路径积分(MPPI),后者在长时程上维持多个连贯的假设,避免了分支展开下的模式平均。同时,ELVIS 利用共享的感知不确定性的 lambda 回报来稳定深度想象:一个隐式评论家集成定义了置信上界(UCB)分数,该分数控制一个时变 lambda,自适应地权衡自举与前瞻,以限制规划期间的复合误差。相同的回报既用于从想象展开中训练 actor-critic 先验,也用于在 GMM-MPPI 内部对候选轨迹进行评分,从而使 RL 目标与规划器的长时程优化保持一致。在十四个 DeepMind Control Suite 视觉任务上,与 TD-MPC2 和 DreamerV3 相比,ELVIS 确立了最先进的性能。最后,ELVIS 零样本迁移到具有严重遮挡的真实世界喷砂任务中,改善了表面质量指标并证明了超越模拟的鲁棒性。

关键词

引用

@article{arxiv.2605.04709,
  title  = {ELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPC},
  author = {Yurui Du and Pinhao Song and Yutong Hu and Renaud Detry},
  journal= {arXiv preprint arXiv:2605.04709},
  year   = {2026}
}