CoDA:探索医学视觉语言模型的链式分布攻击与后处理 Token 空间修复
计算机视觉与模式识别
2026-04-06 v2 人工智能
摘要
医学视觉-语言模型 (MVLMs) 日益被用于放射学管道中的感知 backbone 以及多模态助理的视觉前端,但在真实临床工作流程中的可靠性仍未得到充分探索。先前的鲁棒性评估常假设干净、精选的输入或研究孤立的损坏,忽略了保持临床可读性的同时改变图像统计的常规采集、重建、显示和递交操作。为填补此空白,我们提出 CoDA,一个链式分布框架用于构建临床上可信的管道迁移,通过组合采集式阴影、重建和显示重映射,以及递交和导出退化。受到掩码结构相似度约束,CoDA 在联合优化阶段组成和参数以诱导失败同时保持视觉可信度。在脑 MRI、胸 X 光和腹部 CT 上,CoDA 大幌降低了 CLIP 风格 MVLMs 的零样本性能,链式组合始终比单个阶段更具破坏性。我们还评估了多模态大语言模型 (MLLMs) 作为技术真实性监察者的医学图像质量审计可靠性。专有多模态模型显示在 CoDA 移位样本上的监察可靠性下降并持续高置信度错误,而我们测试的医学特定 MLLMs 则清晰显示了在医学图像质量监察方面的缺陷。最后,我们引入一种基于教师引导的 token 空间适应后处理修复策略,通过 patch 级别对齐改善了存档 CoDA 输出的准确性。总体而言,我们的发现刻画了 MVLMs 在部署中的临床依据威胁面并表明轻量级对齐可提高部署中的鲁棒性。
关键词
引用
@article{arxiv.2603.18545,
title = {CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models},
author = {Xiang Chen and Fangfang Yang and Chunlei Meng and Yuxian Dong and Ang Li and Yiwei Wei and Jiahuan Long and Jiujiang Guo and Chengyin Hu},
journal= {arXiv preprint arXiv:2603.18545},
year = {2026}
}