结构锚点剪枝:无训练的多向量压缩用于视觉文档检索
计算机视觉与模式识别
2026-05-22 v2 计算与语言
信息检索
摘要
最近的视觉语言模型(如ColPali)使细粒度视觉文档检索(VDR)成为可能,但造成了巨大的多向量索引存储开销。现有的无训练剪枝方法要么依赖启发式的层选择,要么在激进压缩下性能急剧下降,导致 prior work 认为有效的高压缩剪枝需要query-dependent训练。我们挑战了这种观点,提出了结构锚点剪枝(SAP),这是一种自校准、无训练且query-agnostic的索引时间剪枝框架,包含三个组件:(i)得分保留(SR),用于per-layer压缩诊断;(ii)SR引导的窗口选择,为任何backbone自动定位结构剪枝区域,无需每模型超参数;以及(iii)一个视觉入度中心性评分器,用于识别选定窗口内的锚点patch。在ViDoRe v1/v2基准上,使用覆盖18、28和36个backbone层的三个架构,SAP在无任何每模型参数调优的情况下保留超过90%的NDCG@5,同时剪枝超过90%的视觉token。我们的层解析SR分析揭示了Alignment-Aggregation发散:文档的视觉结构在backbone中被保存为稳定的“结构平台”,但最终层将这种表示重新塑造为稀疏、query对齐形式,已不适合剪枝。这就是SAP在最终层方法失败的机制原因。
引用
@article{arxiv.2601.20107,
title = {Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval},
author = {Zhuchenyang Liu and Ziyu Hu and Yao Zhang and Yu Xiao},
journal= {arXiv preprint arXiv:2601.20107},
year = {2026}
}
备注
methodology revision and new title