中文

渲染而非解码:具有潜空间结构解耦的权重空间世界模型

计算机视觉与模式识别 2026-05-11 v2 人工智能

摘要

在海量无标签视频上训练世界模型是实现完全自主智能的关键一步。然而,将原始像素编码为不透明的潜空间并依赖重型解码器进行重建的主流范式使得这些模型计算成本高昂且不可解释。我们通过引入 NOVA 来解决这个问题,这是一个世界建模框架,将系统状态表示为基于坐标的辅助隐式神经表示 (INR) 的权重和偏置。这种结构化表示通过解析渲染生成,消除了解码器瓶颈,同时赋予了紧凑性、可移植性和零样本超分辨率。此外,像大多数潜动作模型一样,NOVA 可以通过动作匹配目标被蒸馏为上下文相关的视频生成器。令人惊讶的是,无需诉诸辅助损失或对抗目标,NOVA 就能解耦背景、前景和帧间运动等结构化场景组件,使用户能够编辑内容或动态而不影响另一方。我们在几个具有挑战性的数据集上验证了我们的框架,在单个消费级 GPU 上以约 40M 参数运行时实现了强大的可控预测。最终,像 INR 这样的结构化表示不仅增强了我们对潜在动态的理解,也为沉浸式和可定制的虚拟体验铺平了道路。

关键词

引用

@article{arxiv.2605.06298,
  title  = {Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement},
  author = {Roussel Desmond Nzoyem and Mauro Comi},
  journal= {arXiv preprint arXiv:2605.06298},
  year   = {2026}
}

备注

35 pages, 30 figures, 8 tables