中文

MosaicMem:用于可控视频世界模型的混合空间记忆

计算机视觉与模式识别 2026-03-19 v1

摘要

视频扩散模型正在从短暂、合理的片段向需要在相机运动、 revisit 和 intervention 下保持一致性的世界模拟器发展。然而,空间记忆仍是一个关键瓶颈:显式的 3D 结构可改进基于重投影的一致性,但难以描绘移动对象;而隐式记忆即使在正确姿态下也常产生不准确的相机运动。我们提出了 Mosaic Memory(MosaicMem),一种混合空间记忆,将 patch 提升到 3D 以实现可靠的局部化和目标检索,同时利用模型的原生 conditioning 保留 prompt-following 生成。MosaicMem 通过 patch-and-compose 接口在查询视图中组合空间对齐的 patch,保留应持续的内容,同时允许模型对应演化的内容进行 inpaint。配合 PRoPE 相机 conditioning 和两种新的记忆对齐方法,实验显示相对于隐式记忆具有更好的姿态遵从性,相对于显式基线具有更强的动态建模。MosaicMem 进一步实现了分钟级 navigation、基于记忆的场景编辑和自回归 rollout。

关键词

引用

@article{arxiv.2603.17117,
  title  = {MosaicMem: Hybrid Spatial Memory for Controllable Video World Models},
  author = {Wei Yu and Runjia Qian and Yumeng Li and Liquan Wang and Songheng Yin and Sri Siddarth Chakaravarthy P and Dennis Anthony and Yang Ye and Yidi Li and Weiwei Wan and Animesh Garg},
  journal= {arXiv preprint arXiv:2603.17117},
  year   = {2026}
}

备注

Project Page: https://mosaicmem.github.io/mosaicmem/