中文

面向医学视觉语言模型的层级特定精调:提高否定处理能力

计算机视觉与模式识别 2026-02-16 v1

摘要

否定是临床报告中基本的语言操作, 但视觉语言模型(VLMs)常常难以区分肯定与否定的医学陈述. 为系统性表征此限制, 我们引入放射学专用诊断基准, 在受控临床条件下评估极性灵敏性, 揭示常见医学 VLMs 在否定与非否定发现上持续混淆. 为支持超越简单缺失条件的学习, 我们进一步构建情境临床否定数据集, 其编码结构化主张并支持涉及位置与严重程度的属性级否定. 基于这些资源, 我们提出 Negation-Aware Selective Training (NAST), 这是一种以可解释性为导向的适应方法, 其利用因果追踪效应(CTEs)调制微调期间的层级梯度更新. 不同于均匀应用学习率, NAST 根据各层对否定处理的因果贡献, 对其更新进行比例放大, 将机理可解释性信号转化为原则化的优化规则. 实验结果表明, 该方法在不损害视觉语言对齐的前提下, 提升了肯定与否定临床陈述的辨识能力, 凸显了因果可解释性在安全关键医疗环境中针对性模型适应的价值. 代码与资源已置于 https://github.com/healthylaife/NAST.

引用

@article{arxiv.2602.12498,
  title  = {Layer-Specific Fine-Tuning for Improved Negation Handling in Medical Vision-Language Models},
  author = {Ali Abbasi and Mehdi Taghipour and Rahmatollah Beheshti},
  journal= {arXiv preprint arXiv:2602.12498},
  year   = {2026}
}

备注

15 pages, 5 figures. Submitted to ICML 2026