为何训练-free token 缩减会崩溃:成对评分信号的内在不稳定性
人工智能
2026-04-21 v1 计算机视觉与模式识别
摘要
面向 Vision Transformer 的训练-free token 缩减方法(ToMe、ToFu、PiToMe 和 MCTF)采用不同的评分机制,却在高压缩率下表现出相似的临界崩溃。本文解释了"为什么"。我们发展了一个诊断框架,包含两个工具:排序一致性 和非对角相关性 ,将崩溃分解为 (1) 层级缩减固有的信号不可辨误差放大器,预测凸 Pareto 曲线和 ;以及 (2) 对成对相似性信号的广泛依赖,其排序一致性在深层从 下降到 。成对排名在 联合扰动下天然不稳定,而单值信号受扰动影响较小( 扰动,大数定理)。基于这三个设计原则,我们构建了 CATIS 作为建设性验证:单值信号提高触发阈值, triage 抑制增益。在 ViT-Large 上进行 63% 的 FLOPs 减少时,CATIS 保留了 96.9% 的原始准确率(81.0%),而所有基线在 ImageNet-1K 上崩溃至 43--65%。
引用
@article{arxiv.2604.16745,
title = {Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals},
author = {Yang Shanglin},
journal= {arXiv preprint arXiv:2604.16745},
year = {2026}
}