WorldPack:压缩记忆提升视频世界建模的空间一致性
计算机视觉与模式识别
2025-12-03 v1 机器学习
摘要
视频世界模型因能够在给定过去观察和导航动作的条件下,生成高保真的未来视觉观察而引起广泛关注。然而,由于对长上下文输入计算成本高昂,尤其是如何实现时序和空间一致性、长期建模 remains unresolved,甚至连最新的 SOTA 模型也难以解决。为此,本文提出了 WorldPack——一种具备高效压缩记忆的数据驱动视频世界模型,显著提升了在较短上下文长度下进行长期生成时的空间一致性、保真度和生成质量。我们的压缩记忆由轨迹打包(trajectory packing)和记忆检索(memory retrieval)组成;轨迹打包实现了高效的上下文利用,而记忆检索在 rollout 中维持一致性,并有助于需要空间推理的长期生成。我们的性能在 LoopNav——一个专为评估长期一致性而设计的 Minecraft 基准测试中进行评估,实验证明 WorldPack 在空间一致性方面显著优于强大的 SOTA 模型。
引用
@article{arxiv.2512.02473,
title = {WorldPack: Compressed Memory Improves Spatial Consistency in Video World Modeling},
author = {Yuta Oshima and Yusuke Iwasawa and Masahiro Suzuki and Yutaka Matsuo and Hiroki Furuta},
journal= {arXiv preprint arXiv:2512.02473},
year = {2025}
}