中文

TokenSeg:通过分层视觉 Token 压缩实现高效 3D 医学图像分割

计算机视觉与模式识别 2026-01-09 v1

摘要

由于体素处理的立方级增长以及同质区域上的冗余计算,三维医学图像分割是一项基础但计算要求高的任务。为了解决这些局限性,我们提出了 TokenSeg,一个用于高效 3D 医学体积分割的边界感知稀疏 token 表示框架。具体而言,(1) 我们设计了一个多尺度分层编码器,在四个分辨率级别上提取 400 个候选 token,以捕获全局解剖上下文和精细的边界细节;(2) 我们引入了一个边界感知分词器,将 VQ-VAE 量化与重要性评分相结合,以选择 100 个显著 token,其中超过 60% 位于肿瘤边界附近;(3) 我们开发了一个稀疏到密集解码器,通过 token 重投影、渐进上采样和跳跃连接重建全分辨率掩码。在包含 960 个病例的 3D 乳腺 DCE-MRI 数据集上的大量实验表明,TokenSeg 实现了最先进的性能,Dice 达 94.49%,IoU 达 89.61%,同时分别将 GPU 内存和推理延迟降低了 64% 和 68%。为了验证泛化能力,我们在 MSD 心脏和脑部 MRI 基准数据集上的评估表明,TokenSeg 在异构解剖结构上始终提供最佳性能。这些结果突显了解剖学信息驱动的稀疏表示对于准确且高效的 3D 医学图像分割的有效性。

关键词

引用

@article{arxiv.2601.04519,
  title  = {TokenSeg: Efficient 3D Medical Image Segmentation via Hierarchical Visual Token Compression},
  author = {Sen Zeng and Hong Zhou and Zheng Zhu and Yang Liu},
  journal= {arXiv preprint arXiv:2601.04519},
  year   = {2026}
}