Astra:基于自回归去噪的通用交互式世界模型
计算机视觉与模式识别
2026-01-28 v3 人工智能
机器学习
摘要
近期扩散Transformer的进展使视频生成模型能够从文本或图像生成高质量视频片段。然而,能够从过去观测和动作预测长期未来的世界模型仍未被充分探索,尤其是针对通用场景和各种形式的交互。为了弥补这一差距,我们提出Astra,一个交互式通用世界模型,能够为多样化场景(如自动驾驶、机器人抓取)生成真实未来,并支持精确的动作交互(如相机运动、机器人动作)。我们提出一种自回归去噪架构,并利用时间因果注意力聚合过去观测以支持流式输出。我们采用噪声增强历史记忆以避免过度依赖过去帧,从而在响应性与时间一致性之间取得平衡。为了实现精确的动作控制,我们引入一个动作感知适配器,直接将动作信号注入去噪过程。我们进一步开发了一种动作专家混合机制,动态路由异构动作模态,增强在探索、操作和相机控制等多种真实世界任务中的通用性。Astra实现了交互式、一致且通用的长期视频预测,并支持多种形式的交互。在多个数据集上的实验证明了Astra在保真度、长期预测和动作对齐方面相较于现有最先进世界模型的改进。
引用
@article{arxiv.2512.08931,
title = {Astra: General Interactive World Model with Autoregressive Denoising},
author = {Yixuan Zhu and Jiaqi Feng and Wenzhao Zheng and Yuan Gao and Xin Tao and Pengfei Wan and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2512.08931},
year = {2026}
}
备注
Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra