中文

视觉Transformer用于肿瘤分割的最优块尺寸探索

图像与视频处理 2023-09-01 v1 计算机视觉与模式识别 机器学习

摘要

转移性结直肠癌(mCRC)中肿瘤的检出在肝癌早期诊断与治疗中起着关键作用。以全卷积神经网络(FCNNs)为骨干的深度学习模型已成为分割三维计算机断层扫描(CT)影像的主导模型。然而,由于其卷积层受限于有限的核尺寸,无法捕捉长程依赖与全局上下文。为克服此局限,视觉Transformer被引入以解决FCNN感受野的局部性。尽管Transformer能捕获长程特征,但由于模型对输入块尺寸敏感,其分割性能随肿瘤大小不同而下隆。寻找最优块尺寸可提升基于视觉Transformer的模型在分割任务上的表现,但这是一项耗时且具挑战的流程。本文提出一种依据转移灶平均体积大小来选择视觉Transformer最优输入多分辨率图像块尺寸的技术。我们进一步通过迁移学习技术验证所提框架,表明采用建议理想块尺寸在较大肿瘤体积训练数据上预训练、再以较小块尺寸训练,可获得最高Dice相似系数(DSC)性能。我们通过在多分辨率公开数据集上预训练模型对该思路进行实验评估。当应用于平均肿瘤体积更小的私有多分辨率mCRC数据集时,模型展现出稳定且提升的结果。本研究为利用视觉Transformer优化小目标语义分割奠定基础。实现源代码见:https://github.com/Ramtin-Mojtahedi/OVTPS。

关键词

引用

@article{arxiv.2308.16598,
  title  = {Towards Optimal Patch Size in Vision Transformers for Tumor Segmentation},
  author = {Ramtin Mojtahedi and Mohammad Hamghalam and Richard K. G. Do and Amber L. Simpson},
  journal= {arXiv preprint arXiv:2308.16598},
  year   = {2023}
}