中文

基于令牌级表示学习的增强3D Transformer分割模型用于医学图像

计算机视觉与模式识别 2024-08-13 v1

摘要

在医学图像领域,尽管各种工作发现Swin Transformer在像素级稠密预测方面具有前景,但在不使用额外数据集进行预训练的情况下,这些模型是否能够进一步提升下游语义分割性能尚未探索。先前表示学习方法的应用受限于3D体积数量有限和高计算成本的限制。此外,大多数专为Transformer设计的预文本任务并不适用于Swin Transformer的层次结构。因此,本工作提出了一种令牌级表示学习损失,该损失最大化来自不同增强视图的令牌嵌入之间的一致性,而不是基于体积级别的全局特征。此外,我们识别到这种新损失exclusive地引发的潜在表示坍缩。为防止坍缩,我们发明了一种简单的“旋转-恢复”机制,该机制对输入体积的一个增强视图进行旋转和翻转,然后恢复特征图中令牌的顺序。我们还修改了对比损失,以解决同一位置但来自不同体积的令牌之间的判别问题。我们在两个公共医学分割数据集上测试了我们的预训练方案,下游分割任务的结果显示,我们的方法在其他最先进的预训练方法方面具有更大的改进。

关键词

引用

@article{arxiv.2408.05889,
  title  = {Enhancing 3D Transformer Segmentation Model for Medical Image with Token-level Representation Learning},
  author = {Xinrong Hu and Dewen Zeng and Yawen Wu and Xueyang Li and Yiyu Shi},
  journal= {arXiv preprint arXiv:2408.05889},
  year   = {2024}
}