Spark3R:非对称 Token 缩减实现快速前馈 3D 重建
计算机视觉与模式识别
2026-05-20 v2
摘要
基于 Vision Transformer 的前馈 3D 重建模型可以直接从少量输入图像中估计场景几何和相机位姿,但由于全局注意力层的二次方代价,将其扩展到具有数百或数千帧的视频输入仍然具有挑战性。最近的 token 合并方法通过压缩全局注意力层内的 token 序列来加速这些模型,但它们对 query token 和 key-value token 施加统一的缩减,忽略了它们在 3D 重建中功能上截然不同的角色。在这项工作中,我们发现了前馈 3D 重建模型的一个关键特性:query token 编码特定视图的几何请求且对压缩敏感,而 key-value token 表示共享的场景上下文且能容忍激进压缩。受此洞察启发,我们提出了 Spark3R,这是一个免训练的加速框架,通过分配不同的缩减因子来解耦 query token 和 key-value token 的压缩,其中组内 token 合并应用于 query token,轻量级 token 剪枝应用于 key-value token。此外,Spark3R 跨层自适应地调整 key-value 缩减因子,进一步改善了质量与效率的权衡。作为一个无需重训练的即插即用框架,Spark3R 直接集成到多个预训练的前馈 3D 重建模型中,包括 VGGT、、Depth-Anything-3 和 VGGT-,在 1,000 帧输入上实现了高达 的加速,同时保持了具有竞争力的重建质量。
引用
@article{arxiv.2605.06270,
title = {Spark3R: Asymmetric Token Reduction Makes Fast Feed-Forward 3D Reconstruction},
author = {Zecheng Tang and Jiaye Fu and Qiankun Gao and Haijie Li and Yanmin Wu and Jiaqi Zhang and Siwei Ma and Jian Zhang},
journal= {arXiv preprint arXiv:2605.06270},
year = {2026}
}