面向可解释 ROP 筛查的上下文感知非对称集成模型:主动查询与血管注意力
图像与视频处理
2026-02-23 v2 计算机视觉与模式识别
摘要
视网膜早发性视网膜脱垂(ROP)是可预防的儿童失明主要原因之一。自动化筛查仍具有挑战,主要由于数据可得性有限以及涉及结构分期和微血管异常的复杂情况。当前深度学习模型依赖大量私有数据和被动多模态融合,这些方法在小规模、不平衡的公开队列中往往难以泛化。因此,我们提出了上下文感知非对称集成模型(CAA Ensemble),通过两个专门化的流模块模拟临床推理路径。首先,多尺度主动查询网络(MS-AQNet)作为结构专家,利用临床上下文作为动态查询向量,对视觉特征提取进行空间控制,以定位纤维血管脓垂。其次,VascuMIL 在门控多实例学习(MIL)网络中编码血管拓扑图(VMAP),以精确识别血管扭转。一个协同的元学习器对这两种正交信号进行集成,以解决诊断在多个目标上的不一致。该框架在 188 名婴儿(6,004 张图像)的高度不平衡队列上测试,实现了两个临床任务的最先进表现:实现 0.93 的宏平均 F1 分数用于广泛 ROP 分期,实现 0.996 的 AUC 用于 Plus 病检测。关键的是,该系统通过反事实注意力热图和血管威胁图实现“玻璃盒”透明度,证明临床元数据决定模型的视觉搜索方式。此外,本研究表明,架构归纳偏差可作为医学 AI 数据差距的有效桥梁。
引用
@article{arxiv.2602.05208,
title = {Context-Aware Asymmetric Ensembling for Interpretable Retinopathy of Prematurity Screening via Active Query and Vascular Attention},
author = {Md. Mehedi Hassan and Taufiq Hasan},
journal= {arXiv preprint arXiv:2602.05208},
year = {2026}
}
备注
16 pages, 6 figures