中文

BertsWin:通过组件平衡结构优化解决3D掩码自编码器的拓扑稀疏性

计算机视觉与模式识别 2025-12-29 v1 机器学习 图像与视频处理

摘要

自监督学习 (SSL) 和 Vision Transformer (ViT) 方法的应用在二维医学成像领域展现出可喜的成果,但将这些方法应用于三维体积图像却困难重重。标准的掩码自编码器 (MAE) 作为二维领域的最先进解决方案,难以捕捉三维空间关系,尤其是在预训练期间丢弃 75% 的 token 时。我们提出 BertsWin,一种结合 Swin Transformer 窗口的全 BERT 风格 token 掩码的混合架构,旨在增强 SSL 预训练期间三维空间上下文的学习。与仅处理可见区域的传统 MAE 不同,BertsWin 引入了完整的 token 三维网格(掩码与可见),从而保留了空间拓扑。为平滑 ViT 的二次复杂度,使用了单层局部 Swin 窗口。我们引入了结构优先损失函数,并评估了颞下颌关节锥形束计算机断层扫描的结果。后续评估包括三维 CT 扫描上的 TMJ 分割。我们证明,BertsWin 架构通过维持完整的三维空间拓扑,与标准 ViT-MAE 基线相比,本质上将语义收敛速度提高了 5.8 倍。此外,结合我们提出的 GradientConductor 优化器,完整的 BertsWin 框架在达到最先进重建保真度所需的训练轮次上实现了 15 倍的减少(44 对 660)。分析表明,BertsWin 实现了这种加速,且没有密集体积处理通常带来的计算惩罚。在标准输入分辨率下,该架构保持了与稀疏 ViT 基线的理论 FLOP 等价性,由于更快的收敛速度,总计算资源实现了显著的净减少。

关键词

引用

@article{arxiv.2512.21769,
  title  = {BertsWin: Resolving Topological Sparsity in 3D Masked Autoencoders via Component-Balanced Structural Optimization},
  author = {Evgeny Alves Limarenko and Anastasiia Studenikina},
  journal= {arXiv preprint arXiv:2512.21769},
  year   = {2025}
}

备注

Code available at https://github.com/AlevLab-dev/BertsWinMAE and https://github.com/AlevLab-dev/GCond. Zenodo repository (DOI: 10.5281/zenodo.17916932) contains source images, training logs, trained models, and code