超越 U-Net:评估视觉 Transformer 在显微图像分析语义分割中的应用
图像与视频处理
2024-09-26 v1 计算机视觉与模式识别
摘要
分割是显微图像分析中的关键步骤。过去数年间已发展出众多方法,涵盖从经典分割算法到先进的深度学习模型。尽管 U-Net 仍是生物医学分割任务中最受欢迎且最成熟的模型之一,但近期开发的基于 Transformer 的模型有望提升显微图像的分割过程。在本研究中,我们评估了 Transformer 的有效性,包括 UNETR、Segment Anything Model 和 Swin-UPerNet,并将其与成熟的 U-Net 模型在多种图像模态下进行了比较,如电子显微镜、明场、组织病理学和相差显微镜。我们的评估发现了原始 Swin Transformer 模型中的若干局限性,并通过架构修改对其进行了优化以提升性能。结果表明,与经典 U-Net 模型和未修改的 Swin-UPerNet 相比,这些修改提升了分割性能。这项比较分析突显了 Transformer 模型在推进生物医学图像分割方面的潜力,并表明通过精细的修改可以提高其效率与适用性,从而促进其在未来显微图像分析工具中的应用。
引用
@article{arxiv.2409.16940,
title = {Going Beyond U-Net: Assessing Vision Transformers for Semantic Segmentation in Microscopy Image Analysis},
author = {Illia Tsiporenko and Pavel Chizhov and Dmytro Fishman},
journal= {arXiv preprint arXiv:2409.16940},
year = {2024}
}
备注
to be published in ECCV 2024 BioImage Computing Workshop