MedPruner:面向高效 3D 医学图像理解的训练-free 层次化 Token 剪枝
计算机视觉与模式识别
2026-03-13 v1 人工智能
摘要
虽然专门的医学视觉语言模型 (VLM) 在解释 2D 和 3D 医学模态方面取得了显著成功,但其用于 3D 体数据仍受到显著的计算效率限制。当前架构通常因直接拼接连续 2D 切片而产生大量解剖冗余,且缺乏针对不同切片中异构信息密度的灵活处理能力,固定剪枝比例成为瓶颈。为此,我们提出 MedPruner,一个针对高效 3D 医学图像理解设计的训练-free 且与模型无关的层次化 token 剪枝框架。MedPruner 引入两个阶段:首先通过基于切片锚点的过滤模块消除切片级时序冗余;随后通过量化累计注意力权重实现自适应 token 级压缩。在三个 3D 医学基准测试和三个多样化医学 VLM 上进行的大量实验揭示了现有架构中的大量 token 冗余。值得注意的是,MedPruner 使诸如 MedGemma 等模型在保留少于 5% 视觉 token 的情况下,能够保持甚至提升其原始性能,从而大幅降低计算开销,验证了动态 token 选择在实际临床部署中的必要性。我们的代码将在发布。
引用
@article{arxiv.2603.11625,
title = {MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models},
author = {Shengyuan Liu and Zanting Ye and Yunrui Lin and Chen Hu and Wanting Geng and Xu Han and Bulat Ibragimov and Yefeng Zheng and Yixuan Yuan},
journal= {arXiv preprint arXiv:2603.11625},
year = {2026}
}
备注
10 pages