中文

RD-ViT:降低数据依赖的循环深度 Vision Transformer 用于语义分割——将循环深度 Transformer 架构扩展至密集预测

计算机视觉与模式识别 2026-05-06 v1

摘要

Vision Transformer (ViT) 实现了 SOTA 的分割精度,但由于每层具有必须独立学习的独特参数,因此需要大型训练数据集。我们提出 RD-ViT,一种循环深度 Vision Transformer,将循环深度 Transformer (RDT) 架构适配至密集预测任务,支持 2D 和 3D 输入。RD-ViT 用循环 T 次的单个共享块替代了独特 Transformer 块的深度堆叠,并通过 LTI 稳定状态注入以保证收敛、自适应计算时间 (ACT) 用于空间计算分配、深度 LoRA 适应,以及可选的混合专家 (MoE) 前馈网络用于类别特定专门化来进行增强。我们在 2D 切片级和 3D 体积设置下的 ACDC 心脏 MRI 分割基准上进行评估,所有真实实验均在 Google Colab 中执行。在 2D 中,RD-ViT 在 10% 训练数据(Dice 0.774 vs 0.762)和全量数据(0.882 vs 0.872)下均优于标准 ViT。在 3D 中,带有 MoE 的 RD-ViT 在 3.0M 参数下实现了 0.812 的 Dice,在 53% 参数量下达到了标准 ViT 性能(0.817)的 99.4%。MoE 专家利用率分析表明,不同专家在没有显式路由监督的情况下自发地专门化于不同的心脏结构(RV、MYO、LV)。ACT 停止图显示在心脏边界处有更高的计算分配,且训练期间平均思考时间从 2.6 次迭代减少至 1.4 次,证明了学习到的计算效率。深度外推允许使用比训练时更多的循环进行推理而不产生性能退化。所有代码、笔记本和结果均已公开发布。

关键词

引用

@article{arxiv.2605.03999,
  title  = {RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction},
  author = {Renjie He},
  journal= {arXiv preprint arXiv:2605.03999},
  year   = {2026}
}