VMem:基于surfel索引视图记忆的一致性交互式视频场景生成
计算机视觉与模式识别
2025-08-15 v3
摘要
我们提出了一种 novel memory module for building video generators capable of interactively exploring environments. 之前的方法要么通过对场景2D视图进行扩展并逐步重建其3D几何——这会快速积累误差——要么使用短时记忆窗口的视频生成器,难以在长期保持场景连贯性。为克服这些限制,我们引入了基于3D表面元素(surfel)对观察视图进行几何索引的视图记忆(VMem)。VMem enables efficient retrieval of the most relevant past views when generating new ones. 通过仅聚焦于这些相关视图,我们的方法在计算成本为使用全部历史视图作为上下文的十分之一时,能够生成一致的想象环境探索。我们在具有挑战性的长期场景合成基准上进行评估,证明了我们的方法在维持场景连贯性和相机控制方面优于现有方法。
关键词
引用
@article{arxiv.2506.18903,
title = {VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory},
author = {Runjia Li and Philip Torr and Andrea Vedaldi and Tomas Jakab},
journal= {arXiv preprint arXiv:2506.18903},
year = {2025}
}
备注
ICCV 2025 highlight. Project page: https://v-mem.github.io