DexWorldModel:面向自动化学习的因果潜在世界模型
计算机视觉与模式识别
2026-04-21 v1 人工智能
摘要
为操作任务部署生成式 World-Action Models 严重受限于冗余的像素级重建、 的内存扩展以及顺序推理延迟。我们引入了因果潜在世界模型(CLWM),其采用 DINOv3 特征作为生成目标,以分离交互语义和视觉噪声,实现高度稳健的域泛化。为克服内存扩展,CLWM 具备 Dual-State Test-Time Training(TTT)内存,确保长期任务具有严格的 存储空间。为克服部署延迟,我们提出了具象化异步推理(SAI),以掩盖物理执行后的部分扩散去噪,将阻塞延迟约降低 50%。为扩展稳健策略,我们提出了 EmbodiChain,一个在线框架,通过注入源自物理世界的轨迹来建立效率法则。广泛的实验表明,CLWM 在复杂双臂模拟和首次实现的零样本 sim-to-real 迁移到物理机器人上实现了业界领先的性能,超越了在真实世界数据上显式微调的基线方法。
引用
@article{arxiv.2604.16484,
title = {DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks},
author = {Yueci Deng and Guiliang Liu and Kui Jia},
journal= {arXiv preprint arXiv:2604.16484},
year = {2026}
}