KEPIL:面向提示稳健疾病检测的知识增强提示-图像学习
计算机视觉与模式识别
2026-05-12 v1
摘要
视觉-语言模型(VLM)因能够联合推理放射学图像和临床文本,从而利用互补临床信息而在放射学临床决策支持方面显示出潜力。然而,放射学发现在实际应用中呈长尾分布,导致某些疾病 underrepresented,使得零样本推断至关重要。然而,当前的 CLIP 风格医学 VLM 对提示变体敏感,且缺乏可靠的外部知识,这会阻碍其在临床部署中的可靠性。我们提出 \textit{KEPIL},一个面向提示稳健的框架,通过整合精选医学知识来稳定零样本泛化。KEPIL 包含:(i) 使用医学本体论结合 LLM 辅助的动态提示丰富;(ii) 语义感知对比损失,通过双嵌入目标对齐等价提示变体的嵌入;(iii) 实体中心的报告标准化,以获得与本体论对齐的表示。 在七个基准测试中,KEPIL 实现了零样本推断的最佳性能;在提示变体测试中,其在 \textit{CheXpert} 上的 AUC 提升了 ,平均提升 。这些结果表明,结构化知识和稳健的提示设计是临床可靠放射学 VLM 的关键。代码将发布于 https://github.com/Roypic/KEPIL。
引用
@article{arxiv.2605.09132,
title = {KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection},
author = {Haozhe Luo and Shelley Zixin Shu and Ziyu Zhou and Robert Berke and Mauricio Reyes},
journal= {arXiv preprint arXiv:2605.09132},
year = {2026}
}