Bi-MCQ:用于否定理解的视觉语言对齐重构
计算机视觉与模式识别
2026-02-02 v1 机器学习
摘要
近期视觉语言模型 (VLM) 通过大规模图像-文本预训练实现了强大的零样本性能,在医学图像分析中得到广泛应用。然而,现有 VLM 在理解否定临床表述方面仍显著薄弱,主要由于对比式对齐目标将否定视为语言上的微小变异,而非意义反转运算符。在多标签设置下,基于提示的 InfoNCE 微调进一步强化了易正面图像-提示对齐,限制了有效学习疾病缺失的能力。为克服这些限制,我们将视觉语言对齐重新表述为条件语义比较问题,通过一种双向多选学习框架 (Bi-MCQ) 实现。该方法通过联合训练图像到文本和文本到图像的 MCQ 任务,涵盖肯定、否定和混合提示,使微调过程从全局相似度最大化转为条件语义比较。我们进一步引入方向特定的跨注意力融合模块,以解决双向推理所需的非对称线索问题,减少对齐干扰。在 ChestXray14、Open-I、CheXpert 和 PadChest 数据集上进行的实验表明,Bi-MCQ 在 CARZero 模型的零样本性能基础上,以最高达 0.47 的 AUC 提升显著改善了否定理解能力,同时在正负综合 (PNC) 评估中实现最高达 0.08 的绝对提升。此外,Bi-MCQ 相对于基于 InfoNCE 的微调方法,将肯定-负面 AUC 差值平均降低 0.12,表明目标重构在医学 VLM 的否定理解方面具有显著提升作用。
引用
@article{arxiv.2601.22696,
title = {Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding},
author = {Tae Hun Kim and Hyun Gyu Lee},
journal= {arXiv preprint arXiv:2601.22696},
year = {2026}
}
备注
15 pages, 4 figures, Submitted to ICPR 2026 (under review)