中文

Mem3R:通过测试时训练实现混合记忆的流式 3D 重建

计算机视觉与模式识别 2026-04-09 v1

摘要

流式 3D 感知非常适合机器人和增强现实场景,其中必须高效且一致地处理长视觉流。近年来的循环模型通过维持固定大小的状态并实现线性时间推理提供了一个有前景的解决方案,但由于压缩潜在记忆的有限容量,它们在长序列中常遭受漂移累积和时间遗忘。我们提出了 Mem3R,一个具有混合记忆设计的流式 3D 重建模型,将相机跟踪与几何映射解耦以提高长序列中的时间一致性。对于相机跟踪,Mem3R 采用通过测试时训练更新的轻量级多层感知器实现的隐式快速权重记忆。对于几何映射,Mem3R 维护一个显式的基于 token 的固定大小状态。与 CUT3R 相比,该设计不仅显著提升了长序列性能,还将模型大小从 793M 减少到 644M 参数。Mem3R 支持为 CUT3R 开发的现有改进即插即用状态更新策略。具体而言,将其与 TTT3R 集成后,在 500 到 1000 帧序列上,绝对轨迹误差相比基础实现最多降低了 39%。所得改进还扩展到其他下游任务,包括视频深度估计和 3D 重建,同时保持了恒定的 GPU 内存占用和可比的推理吞吐量。项目页面:https://lck666666.github.io/Mem3R/

关键词

引用

@article{arxiv.2604.07279,
  title  = {Mem3R: Streaming 3D Reconstruction with Hybrid Memory via Test-Time Training},
  author = {Changkun Liu and Jiezhi Yang and Zeman Li and Yuan Deng and Jiancong Guo and Luca Ballan},
  journal= {arXiv preprint arXiv:2604.07279},
  year   = {2026}
}

备注

Project page: https://lck666666.github.io/Mem3R/