CTT-Net:一种用于白内障术后视力预测的多视角跨令牌Transformer
图像与视频处理
2022-12-13 v1 计算机视觉与模式识别
摘要
手术是视力(VA)受损白内障患者唯一可行的治疗方法。临床上,为评估白内障手术的必要性,通过在术前分析多视角光学相干断层扫描(OCT)图像准确预测术后VA至关重要。遗憾的是,由于复杂的眼底状况,确定术后VA对医学专家而言仍然困难。近年来开发了针对该问题的深度学习方法。尽管有效,这些方法仍面临若干 issue,例如未高效探索多视角OCT图像间的潜在关联、忽视临床先验知识(如术前VA值)的关键作用,以及仅使用缺乏参照的基于回归的指标。本文中,我们提出一种新颖的跨令牌Transformer网络(CTT-Net),通过分析多视角OCT图像与术前VA进行术后VA预测。为有效融合OCT图像的多视角特征,我们开发了跨令牌注意力以限制冗余/不必要的注意力流动。进一步,我们利用术前VA值为术后VA预测提供更多信息并促进视角间融合。此外,我们设计了一种辅助分类损失以提升模型性能并更充分地评估VA恢复,避免仅用回归指标的局限。为评估CTT-Net,我们构建了来自合作医院的多视角OCT图像数据集。大量实验在各种指标上验证了我们的模型相比现有方法的有效性。代码可在:https://github.com/wjh892521292/Cataract OCT 获取。
引用
@article{arxiv.2212.05794,
title = {CTT-Net: A Multi-view Cross-token Transformer for Cataract Postoperative Visual Acuity Prediction},
author = {Jinhong Wang and Jingwen Wang and Tingting Chen and Wenhao Zheng and Zhe Xu and Xingdi Wu and Wen Xu and Haochao Ying and Danny Chen and Jian Wu},
journal= {arXiv preprint arXiv:2212.05794},
year = {2022}
}
备注
5 pages, 3 figures, accepted for publication in BIBM