中文

UNesT:用于高效医学分割的层次化Transformer局部空间表示学习

图像与视频处理 2023-09-11 v2 计算机视觉与模式识别

摘要

基于Transformer的模型能够学习更好的全局依赖关系,近年来在计算机视觉和医学图像分析中展现出卓越的表示学习能力。Transformer将图像重格式化为独立的块,并通过自注意力机制实现全局通信。然而,块间的位置信息在此类一维序列中难以保留,而在处理3D医学图像分割中大量不同尺寸异质组织时,该信息的丢失会导致次优性能。此外,当前方法对于繁重医学分割任务(如预测大量组织类别或建模全局互连的组织结构)不够鲁棒和高效。为应对这些挑战,并受视觉Transformer中嵌套层次结构的启发,我们提出了一种新颖的3D医学图像分割方法(UNesT),采用简化且更快收敛的Transformer编码器设计,通过层次化聚合在空间相邻块序列间实现局部通信。我们在多个具有挑战性的数据集上广泛验证我们的方法,这些数据集包含多种模态、解剖结构以及广泛的组织类别,包括脑中133个结构、腹部14个器官、肾脏中4个层次化组件、互连的肾脏肿瘤与脑肿瘤。我们表明UNesT持续达到最先进性能,并评估了其泛化性与数据效率。特别地,该模型在单一网络中完成包含133个组织类别的全脑分割任务,优于先前由27个网络集成的SOTA方法SLANT27。

关键词

引用

@article{arxiv.2209.14378,
  title  = {UNesT: Local Spatial Representation Learning with Hierarchical Transformer for Efficient Medical Segmentation},
  author = {Xin Yu and Qi Yang and Yinchi Zhou and Leon Y. Cai and Riqiang Gao and Ho Hin Lee and Thomas Li and Shunxing Bao and Zhoubing Xu and Thomas A. Lasko and Richard G. Abramson and Zizhao Zhang and Yuankai Huo and Bennett A. Landman and Yucheng Tang},
  journal= {arXiv preprint arXiv:2209.14378},
  year   = {2023}
}

备注

19 pages, 17 figures. arXiv admin note: text overlap with arXiv:2203.02430