ZACH-ViT:面向医学影像的紧凑型视觉 Transformer 中的分段相关归纳偏置
摘要
视觉 Transformer 依赖位置嵌入和类别 token 编码固定的空间先验。虽然对自然图像有效,但当空间布局信息弱时,这些先验可能次优,这在医学影像中常见。我们提出 ZACH-ViT(Zero-token Adaptive Compact Hierarchical Vision Transformer),即一种紧凑视觉 Transformer,移除位置嵌入和 [CLS] token,通过全局平均池化实现 patch 的排列不变处理。Zero-token 表示移除专门的聚合 token 和位置编码,patch token 保持不变。自适应残差投影在严格的参数约束下维持训练稳定性。我们在七个 MedMNIST 数据集上评估 ZACH-ViT,采用严格的 few-shot 协议(50 样本/类别、固定超参数、五个随机种子)。结果揭示了分段相关的行为:ZACH-ViT(0.25M 参数,从头训练)在 BloodMNIST 上取得最强优势,在 PathMNIST 上保持竞争力,而在具有更强解剖先验的数据集(OCTMNIST、OrganAMNIST)上相对优势减弱,与我们的假设一致。组件和池化消融实验表明,随着空间结构增强,位置信息的支持变得略有帮助,而重新引入 [CLS] token 则始终不利。这些发现表明,架构与数据结构的匹配度可以超过普适基准的优势。尽管模型极小且无预训练,ZACH-ViT 在数据稀缺条件下仍能实现竞争性能,这对紧凑医学影像和低资源场景具有意义。代码:https://github.com/Bluesman79/ZACH-ViT
引用
@article{arxiv.2602.17929,
title = {ZACH-ViT: Regime-Dependent Inductive Bias in Compact Vision Transformers for Medical Imaging},
author = {Athanasios Angelakis},
journal= {arXiv preprint arXiv:2602.17929},
year = {2026}
}
备注
24 pages, 15 figures, 5 tables. Code and models available at https://github.com/Bluesman79/ZACH-ViT