Co-Me:置信度引导的视几何变换器代币合并
计算机视觉与模式识别
2026-05-15 v2 机器人学
摘要
我们提出了置信度引导的代币合并(Co-Me),一种用于视觉几何变换器加速机制,无需重新训练或微调底层模型。Co-Me 通过提炼轻量级置信度预测器对代币按不确定性排序并选择性合并低置信度代币,从而有效减少计算量同时保持空间覆盖。与基于相似性的合并或剪枝相比,Co-Me 中的置信度信号可可靠地指示变换器强调的区域,实现显著加速而不降低性能。Co-Me 可无缝应用于各种多视角和流式视觉几何变换器,加速比随序列长度比例增长。应用于 VGGT 和 Pi3 时,Co-Me 实现最高可达 21.5 倍和 20.4 倍的加速,使视觉几何变换器在实时 3D 感知和重建中实用。
引用
@article{arxiv.2511.14751,
title = {Co-Me: Confidence-Guided Token Merging for Visual Geometric Transformers},
author = {Yutian Chen and Yuheng Qiu and Ruogu Li and Ali Agha and Shayegan Omidshafiei and Jay Patrikar and Sebastian Scherer},
journal= {arXiv preprint arXiv:2511.14751},
year = {2026}
}