中文

为何训练-free token 缩减会崩溃:成对评分信号的内在不稳定性

人工智能 2026-04-21 v1 计算机视觉与模式识别

摘要

面向 Vision Transformer 的训练-free token 缩减方法(ToMe、ToFu、PiToMe 和 MCTF)采用不同的评分机制,却在高压缩率下表现出相似的临界崩溃。本文解释了"为什么"。我们发展了一个诊断框架,包含两个工具:排序一致性 ρs\rho_s 和非对角相关性 ρoff\rho_\text{off},将崩溃分解为 (1) 层级缩减固有的信号不可辨误差放大器,预测凸 Pareto 曲线和 rcrit1/Lr_{\text{crit}} \propto 1/L;以及 (2) 对成对相似性信号的广泛依赖,其排序一致性在深层从 ρs=0.88\rho_s{=}0.88 下降到 0.270.27。成对排名在 O(Np2)O(N_p^2) 联合扰动下天然不稳定,而单值信号受扰动影响较小(O(Np)O(N_p) 扰动,大数定理)。基于这三个设计原则,我们构建了 CATIS 作为建设性验证:单值信号提高触发阈值, triage 抑制增益。在 ViT-Large 上进行 63% 的 FLOPs 减少时,CATIS 保留了 96.9% 的原始准确率(81.0%),而所有基线在 ImageNet-1K 上崩溃至 43--65%。

关键词

引用

@article{arxiv.2604.16745,
  title  = {Why Training-Free Token Reduction Collapses: The Inherent Instability of Pairwise Scoring Signals},
  author = {Yang Shanglin},
  journal= {arXiv preprint arXiv:2604.16745},
  year   = {2026}
}