StreamCacheVGGT:具备稳健评分与混合缓存压缩的流式视觉几何变换器
计算机视觉与模式识别
2026-04-20 v2
摘要
从连续视频流重建稠密3D几何需要在恒定内存预算下保持推理稳定性。现有的 框架主要依赖“纯驱逐”范式,导致因二进制token删除和基于局部单层评分的评估噪声而产生显著信息损失。为解决这些瓶颈,我们提出StreamCacheVGGT,一个无需训练的框架,通过两个协同模块重新构想缓存管理:跨层一致性增强评分(CLCES)和混合缓存压缩(HCC)。CLCES通过在Transformer层级结构中跟踪token重要性轨迹,采用顺序统计分析来识别持续的几何显著性。利用这些稳健的评分,HCC超越简单驱逐,引入三级分类策略,通过在key向量流形上进行最近邻分配,将中等重要性token合并为保留锚点。该方法保留了否则会丢失的关键几何上下文。广泛的评估在五个基准测试(7-Scenes, NRGBD, ETH3D, Bonn, 和 KITTI)中表明,StreamCacheVGGT 设定了新的状态-of-the-art, 在严格遵守恒定成本约束下,实现了卓越的重建精度和长期稳定性。
引用
@article{arxiv.2604.15237,
title = {StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression},
author = {Xuanyi Liu and Chunan Yu and Deyi Ji and Qi Zhu and Lingyun Sun and Xuanfu Li and Jin Ma and Tianrun Chen and Lanyun Zhu},
journal= {arXiv preprint arXiv:2604.15237},
year = {2026}
}