nnMobileNet:面向视网膜病变研究的CNN重构
图像与视频处理
2024-04-17 v4 计算机视觉与模式识别
摘要
过去几十年中,卷积神经网络(CNN)一直处于各种视网膜疾病(RD)检测与追踪的前沿。尽管取得了成功,2020年代视觉Transformer(ViT)的出现改变了RD模型开发的轨迹。基于ViT的模型在RD中的领先性能很大程度上归功于其可扩展性——即随参数增加而提升的能力。因此,基于ViT的模型往往在RD应用中胜过传统CNN,尽管代价是更高的数据和计算需求。ViT处理图像的方式也与CNN不同,其以图像块而非局部区域工作,这可能使RD中小而形态多变病灶的精确定位复杂化。在我们的研究中,我们重新审视并更新了CNN模型(特别是MobileNet)的架构,以增强其在RD诊断中的效用。我们发现,通过选择性修改优化的MobileNet可在包括糖尿病视网膜病变分级、多种眼底疾病检测和糖尿病性黄斑水肿分类在内的各种RD基准上超越基于ViT的模型。代码见https://github.com/Retinal-Research/NN-MOBILENET
引用
@article{arxiv.2306.01289,
title = {nnMobileNet: Rethinking CNN for Retinopathy Research},
author = {Wenhui Zhu and Peijie Qiu and Xiwen Chen and Xin Li and Natasha Lepore and Oana M. Dumitrascu and Yalin Wang},
journal= {arXiv preprint arXiv:2306.01289},
year = {2024}
}
备注
Accepted as a conference paper to 2024 CVPRW