用于全上下文与高分辨率 3D 医学图像分割的 Memory Transformer
计算机视觉与模式识别
2022-10-12 v1
摘要
Transformer 模型在图像分割任务中取得了 SOTA 结果。然而,利用高分辨率 3D 图像实现捕获全局上下文所需的长程注意力是一项根本性挑战。本文引入了全分辨率记忆 Transformer (FINE transformer) 来克服这一问题。FINE 背后的核心思想是学习记忆 token,以间接对全范围交互进行建模,同时在内存和计算成本上具有良好的可扩展性。FINE 在两个层级上引入记忆 token:第一层允许局部图像区域(patch)内体素之间的完全交互,第二层允许 3D 体积所有区域之间的完全交互。两者结合,允许对高分辨率图像(例如 512 x 512 x 256 体素及以上)进行全注意力计算。在 BCV 图像分割数据集上的实验表明,其性能优于 SOTA 的 CNN 和 Transformer 基线,突显了我们全注意力机制相较于近期 Transformer 基线(例如 CoTr 和 nnFormer)的优越性。
引用
@article{arxiv.2210.05313,
title = {Memory transformers for full context and high-resolution 3D Medical Segmentation},
author = {Loic Themyr and Clément Rambour and Nicolas Thome and Toby Collins and Alexandre Hostettler},
journal= {arXiv preprint arXiv:2210.05313},
year = {2022}
}