训练-推理输入对齐大于框架选择在纵向视网膜图像预测中的影响
计算机视觉与模式识别
2026-04-28 v2 人工智能
机器学习
摘要
从纵向影像预测疾病进展对于临床决策和试验设计具有重要价值。近期方法倾向于增加生成复杂性,但这种复杂性何时必要仍不明确。我们提出,生成复杂性应匹配任务条件后验分布可预测组成分的熵,而在所有场景中都需要训练-推理输入对齐。两种模型轻量度量——对原始图像对的任务熵分析和对随机模型的后验集中度分析——让实践者在提交建模框架之前评估任务应有的复杂性。我们在来自多家制造商的视网膜自动荧光(FAF)数据集上验证了该框架,通过对比五种条件配置、共享一个架构和训练集,涵盖标准条件扩散、推理对齐随机训练和确定性回归。训练-推理对齐产生了显著提升(delta-SSIM 提升 0.082,SSIM 提升 0.086,p < 0.001),而在对齐框架之间选择对评估的各项指标没有临床上有意义的差异。在两个 FAF 平台上,访问间的变化主要来自与疾病进展无关的获取变异性,而随机模型的后验收敛到有效点,解释了框架等价性。我们训练了一个确定性 Temporal Retinal U-Net(TRU),在三个制造商和两个模态(两个 FAF 平台和面内 SLO)上评估了 28,899 只眼睛,三个独立队列零样本评估。TRU 在 delta-SSIM、SSIM 和 PSNR 上匹配或超过了三项已发表的基线。在发现表明,当疾病进展缓慢于获取变异时,确定性回归模型可匹配或优于更复杂的随机替代方案。
引用
@article{arxiv.2604.16955,
title = {Training-inference input alignment outweighs framework choice in longitudinal retinal image prediction},
author = {Liyin Chen and Nazlee Zebardast and Mengyu Wang and Tobias Elze and Jason I. Comander},
journal= {arXiv preprint arXiv:2604.16955},
year = {2026}
}