中文

带自适应 PID-Tversky 损失的可解释视觉语言模型框架用于腰椎管狭窄诊断

计算机视觉与模式识别 2026-04-06 v1 人工智能

摘要

腰椎管狭窄(LSS)诊断仍是临床中的关键挑战,诊断严重依赖于对多视角磁共振成像(MRI)的 Labor-intensive 手动解读,导致显著的观察间变异性和诊断延迟。现有的视觉语言模型同时未能解决临床分割数据集中普遍存在的极端类别不平衡问题,同时又保持空间精度,主要是由于全局池化机制丢弃了关键解剖层次结构。我们提出了一个面向解决这些限制的端到端可解释视觉语言模型框架,通过两个主要目标实现。我们提出了空间补丁交叉注意力模块,使其能够实现对脊椎异常的精确、文本导向的局部定位。通过整合控制理论原理动态修改训练惩罚的 novel Adaptive PID-Tversky Loss 函数,进一步针对难以分割的少数实例进行优化。通过将基础 VL 模型与自动化放射术学报告生成模块结合在一起,我们的框架展示了相当大的性能:诊断分类准确率为 90.69%,分割的宏平均 Dice 评分为 0.9512,CIDEr 分数为 92.80%。此外,该框架通过将复杂的分割预测转换为放射科医生风格的临床报告,实现了可解释性,从而在保持必要人类监督的同时提升了诊断能力,为透明、可解释的临床医学影像 AI 树立了新的基准。

关键词

引用

@article{arxiv.2604.02502,
  title  = {An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis},
  author = {Md. Sajeebul Islam Sk. and Md. Mehedi Hasan Shawon and Md. Golam Rabiul Alam},
  journal= {arXiv preprint arXiv:2604.02502},
  year   = {2026}
}