中文

OU-CoViT:具有双适应的双通道多任务视觉Transformer用于OU超广角眼底图像

计算机视觉与模式识别 2024-08-20 v1

摘要

利用尖端的超广角眼底成像技术并结合多种临床评分的联合建模,为眼科中的多任务问题提供了一种有前景的新范式。由眼科“双眼不对称性”现象引发的双通道架构,对基于Transformer的最先进模型提出了新的应用需求。然而,将copula模型应用于深度学习中多个混合离散-连续标签具有挑战性。此外,将先进的大型Transformer模型应用于小型医学数据集也面临过拟合和计算资源限制的挑战。为解决这些问题,我们提出了OU-CoViT:一种新颖的、具有双适应的双通道多任务视觉Transformer,用于OU超广角眼底图像。该模型能够:(i) 通过推导一种新颖的copula损失的闭式解,将多个离散和连续标签之间的相关性纳入深度学习框架;(ii) 利用双通道架构处理双眼图像,同时考虑其高度相关性和不对称性;以及 (iii) 通过双适应机制,使大型视觉Transformer(ViT)能够适应小型医学数据集。大量实验表明,与使用经验损失的单通道基线模型相比,OU-CoViT显著提高了预测性能。此外,OU-CoViT新颖的架构允许其双适应机制和copula损失轻松扩展到其他ViT变体和其他小型医学数据集。我们的工作为多模态输入和混合类型临床评分的联合建模开辟了新的可能性,并有望推动AI辅助临床决策在眼科以外的多个医学领域的发展。

关键词

引用

@article{arxiv.2408.09395,
  title  = {OU-CoViT: Copula-Enhanced Bi-Channel Multi-Task Vision Transformers with Dual Adaptation for OU-UWF Images},
  author = {Yang Li and Jianing Deng and Chong Zhong and Danjuan Yang and Meiyan Li and A. H. Welsh and Aiyi Liu and Xingtao Zhou and Catherine C. Liu and Bo Fu},
  journal= {arXiv preprint arXiv:2408.09395},
  year   = {2024}
}