基于 Copula 增强的 Vision Transformer 通过 OU UWF 眼底图像诊断高度近视
计算机视觉与模式识别
2026-05-04 v2 统计理论
应用统计
统计方法学
统计理论
摘要
AI 辅助近视筛查的进步要求对双眼 (OU) 高度近视 (HM) 状态进行联合诊断并预测眼轴长度 (AL)。这一临床需求引入了一个具有双域 (OU) 图像协变量的复杂混合类型 (二值-连续) 多任务学习任务,带来了两个关键挑战:i) 在前沿基础模型中捕获 OU 图像的眼间不对称性;ii) 建模并估计在给定图像协变量下混合类型多变量响应之间的条件依赖结构。我们通过以下方式应对这些挑战:i) 在 Vision Transformer 基础模型上引入残差适配器,以同时捕获 OU 的相似性和异质性;ii) 基于高斯 Copula 似然的潜变量表示,开发了一个可在 PyTorch 中实现的四维 Copula 损失函数,并提出了一种计算高效的快速蒙特卡洛期望最大化 (fMCEM) 算法来估计 Copula 参数。我们进一步提出了一个特定的过拟合问题,称为多任务学习中的更强协方差现象。我们揭示了该现象对 Copula 参数估计的干扰,并从理论上证明了所提出的 fMCEM 算法在面对该干扰时的数值稳定性。对我们标注的 OU 超广角眼底图像数据集的应用以及对合成数据的模拟表明,我们的方法稳定地提升了分类和回归任务的预测能力。
引用
@article{arxiv.2501.06540,
title = {Copula-enhanced Vision Transformer for high myopia diagnosis through OU UWF fundus images},
author = {Chong Zhong and Yunhao Liu and Yang Li and Xiang Fu and Jin Yang and Danjuan Yang and Meiyan Li and Jinfeng Xu and Aiyi Liu and Alan H. Welsh and Xingtao Zhou and Bo Fu and Catherine C. Liu},
journal= {arXiv preprint arXiv:2501.06540},
year = {2026}
}