注意力机制是医学图像分析中的全部所需吗?一篇综述
计算机视觉与模式识别
2024-02-13 v1 人工智能
机器学习
图像与视频处理
摘要
医学影像是临床诊断、治疗规划和临床试验设计的关键组成部分,几乎占所有医疗数据的 90%。近年来,CNN 在医学图像分析(MIA)中取得了性能提升。CNN 能高效建模局部像素交互,并可在小规模 MI 数据上训练。典型 CNN 模型的主要缺点是忽略图像内的全局像素关系,这限制了其理解具有不同“全局”信息的分布外数据的泛化能力。人工智能的最新进展催生了 Transformer,其可从数据中学习全局关系。然而,完整的 Transformer 模型需在大规模数据上训练且计算复杂度巨大。能够良好保持全局关系建模特性的注意力与 Transformer 模块(Transf/Attention)被提出作为完整 Transformer 的轻量替代。近来,融合 CNN 与 Transf/Attention 架构互补的局部-全局特性呈增长趋势,开启了混合模型的新时代。过去几年中,混合 CNN-Transf/Attention 模型在多样 MIA 问题中显著增长。在本系统综述中,我们调研现有混合 CNN-Transf/Attention 模型,回顾并梳理关键架构设计,分析突破,并评估当前与未来的机遇及挑战。我们还引入了一个基于科学与临床影响泛化机遇的综合分析框架,可据此激发新的数据驱动领域泛化与自适应方法。
引用
@article{arxiv.2307.12775,
title = {Is attention all you need in medical image analysis? A review},
author = {Giorgos Papanastasiou and Nikolaos Dikaios and Jiahao Huang and Chengjia Wang and Guang Yang},
journal= {arXiv preprint arXiv:2307.12775},
year = {2024}
}