中文

DexWorldModel:面向自动化学习的因果潜在世界模型

计算机视觉与模式识别 2026-04-21 v1 人工智能

摘要

为操作任务部署生成式 World-Action Models 严重受限于冗余的像素级重建、O(T)\mathcal{O}(T) 的内存扩展以及顺序推理延迟。我们引入了因果潜在世界模型(CLWM),其采用 DINOv3 特征作为生成目标,以分离交互语义和视觉噪声,实现高度稳健的域泛化。为克服内存扩展,CLWM 具备 Dual-State Test-Time Training(TTT)内存,确保长期任务具有严格的 O(1)\mathcal{O}(1) 存储空间。为克服部署延迟,我们提出了具象化异步推理(SAI),以掩盖物理执行后的部分扩散去噪,将阻塞延迟约降低 50%。为扩展稳健策略,我们提出了 EmbodiChain,一个在线框架,通过注入源自物理世界的轨迹来建立效率法则。广泛的实验表明,CLWM 在复杂双臂模拟和首次实现的零样本 sim-to-real 迁移到物理机器人上实现了业界领先的性能,超越了在真实世界数据上显式微调的基线方法。

关键词

引用

@article{arxiv.2604.16484,
  title  = {DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks},
  author = {Yueci Deng and Guiliang Liu and Kui Jia},
  journal= {arXiv preprint arXiv:2604.16484},
  year   = {2026}
}