中文

Astra:基于自回归去噪的通用交互式世界模型

计算机视觉与模式识别 2026-01-28 v3 人工智能 机器学习

摘要

近期扩散Transformer的进展使视频生成模型能够从文本或图像生成高质量视频片段。然而,能够从过去观测和动作预测长期未来的世界模型仍未被充分探索,尤其是针对通用场景和各种形式的交互。为了弥补这一差距,我们提出Astra,一个交互式通用世界模型,能够为多样化场景(如自动驾驶、机器人抓取)生成真实未来,并支持精确的动作交互(如相机运动、机器人动作)。我们提出一种自回归去噪架构,并利用时间因果注意力聚合过去观测以支持流式输出。我们采用噪声增强历史记忆以避免过度依赖过去帧,从而在响应性与时间一致性之间取得平衡。为了实现精确的动作控制,我们引入一个动作感知适配器,直接将动作信号注入去噪过程。我们进一步开发了一种动作专家混合机制,动态路由异构动作模态,增强在探索、操作和相机控制等多种真实世界任务中的通用性。Astra实现了交互式、一致且通用的长期视频预测,并支持多种形式的交互。在多个数据集上的实验证明了Astra在保真度、长期预测和动作对齐方面相较于现有最先进世界模型的改进。

关键词

引用

@article{arxiv.2512.08931,
  title  = {Astra: General Interactive World Model with Autoregressive Denoising},
  author = {Yixuan Zhu and Jiaqi Feng and Wenzhao Zheng and Yuan Gao and Xin Tao and Pengfei Wan and Jie Zhou and Jiwen Lu},
  journal= {arXiv preprint arXiv:2512.08931},
  year   = {2026}
}

备注

Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra