MEDUSA:用于医学图像分析的多尺度编码器-解码器自注意力深度神经网络架构
图像与视频处理
2021-10-13 v1 计算机视觉与模式识别
摘要
鉴于某些疾病的细微特征以及疾病间外观的显著重叠,医学图像分析持续存在有趣的挑战。在这项工作中,我们探索自注意力概念以应对疾病内部及疾病之间的此类细微差异。为此,我们引入MEDUSA,一种为医学图像分析量身定制的多尺度编码器-解码器自注意力机制。现有文献中的自注意力深度卷积神经网络架构围绕多个孤立的轻量级注意力机制展开,这些机制个体容量有限并被嵌入网络架构的不同位置,而MEDUSA显著背离了这一观念,其拥有单一的、统一的自注意力机制,具有显著更高的容量,多个注意力头汇入网络架构的不同尺度。据作者所知,这是首个“单一主体、多尺度头”的自注意力实现,并在不同表征抽象层级的选择性注意力之间实现了显式全局上下文,同时仍能在各抽象层级上实现不同的局部注意力上下文。借助MEDUSA,我们在包括COVIDx、RSNA RICORD和RSNA Pneumonia Challenge在内的多个具有挑战性的医学图像分析基准上取得了优于既往工作的state-of-the-art性能。我们的MEDUSA模型已公开可用。
引用
@article{arxiv.2110.06063,
title = {MEDUSA: Multi-scale Encoder-Decoder Self-Attention Deep Neural Network Architecture for Medical Image Analysis},
author = {Hossein Aboutalebi and Maya Pavlova and Hayden Gunraj and Mohammad Javad Shafiee and Ali Sabri and Amer Alaref and Alexander Wong},
journal= {arXiv preprint arXiv:2110.06063},
year = {2021}
}