LoGeR:基于混合记忆的长上下文几何重建
计算机视觉与模式识别
2026-04-28 v2 机器学习
摘要
前馈几何基础模型在短窗口重建方面取得了强大的性能,但将其扩展到分钟级视频受到二次注意力复杂度或循环设计中有效记忆有限的瓶颈。我们提出了 LoGeR(Long-context Geometric Reconstruction),一种 novel architecture 能够在无后处理优化的情况下扩展至极长序列的稠密 3D 重建。LoGeR 以块处理视频流,利用强双向先验进行高保真的块内推理。为解决跨块边界一致性的关键挑战,我们提出了基于学习的混合记忆模块。该双组件系统结合了参数化 Test-Time Training(TTT)记忆以锚定全局坐标系并防止尺度漂移,以及非参数化滑动窗口注意力(SWA)机制以保留未压缩的上下文以实现高精度相邻对齐。令人惊讶的是,这种记忆架构使 LoGeR 能够在 128 帧的序列上训练,并在推理时推广到数千帧。我们在标准基准测试和一个新制造的 VBR 数据集(包含最长达 19k 帧的序列)上评估了 LoGeR——在 KITTI 上将 ATE 降低超过 74%,并在前所未有的时段内实现稳健、全局一致的重建。
引用
@article{arxiv.2603.03269,
title = {LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory},
author = {Junyi Zhang and Charles Herrmann and Junhwa Hur and Chen Sun and Ming-Hsuan Yang and Forrester Cole and Trevor Darrell and Deqing Sun},
journal= {arXiv preprint arXiv:2603.03269},
year = {2026}
}
备注
Project page: https://LoGeR-project.github.io/