VL-OrdinalFormer:面向可解释膝关节骨关节炎分级的视觉语言引导的序数变换器
计算机视觉与模式识别
2026-01-06 v1
摘要
膝关节骨关节炎(KOA)是全球致残的主要原因,准确的Kellgren Lawrence(KL)分级系统对临床决策至关重要。然而,早期病 stages,特别是KL1和KL2的放射学区分微妙且常导致放射科医生之间的观察差异。为此,我们提出VLOrdinalFormer,一种视觉语言引导的序数学习框架,用于从膝关节X光片自动评估KOA。该方法将ViT L16主干网络与基于CORAL的序数回归相结合,并采用CLIP驱动的语义对齐模块,使模型能够整合与关节间隙狭窄、骨性骨刺形成和次骨性 sclerosis 相关的临床有意义文本概念。为提高鲁棒性并缓解过拟合,我们采用分层五折交叉验证、类别感知加权以强调挑战性的中间分级,并采用全局阈值优化的测试时增强。在公开的OAI kneeKL224数据集上进行的实验表明,VLOrdinalFormer实现了最先进的性能,在宏F1分数和总体准确率方面均优于CNN和ViT基线。值得注意的是,该框架在KL1和KL2方面取得了显著的性能提升,而不会损害轻度或重度病例的分类准确率。此外,可解释性分析使用Grad CAM和CLIP相似度图确认,模型始终注意于临床相关的解剖区域。这些结果突显了视觉语言对齐序数变换器作为KOA分级和疾病进展评估在常规放射学实践中可靠且可解释的工具的潜力。
引用
@article{arxiv.2601.00879,
title = {VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading},
author = {Zahid Ullah and Jihie Kim},
journal= {arXiv preprint arXiv:2601.00879},
year = {2026}
}