医疗视觉语言模型中谄媚行为的基准测试与缓解
计算机视觉与模式识别
2026-05-29 v7 人工智能
摘要
视觉语言模型有潜力变革医疗工作流程。然而,其部署受到谄媚行为的限制。尽管这对患者安全构成严重威胁,但仍缺乏系统的基准测试。本文通过引入一个医疗基准来填补这一空白,该基准在分层医疗视觉问答任务中对 VLM 应用了多个模板。我们发现当前的 VLM 极易受视觉线索影响,失败率与模型大小或整体准确率显示出相关性。我们发现感知权威和用户模仿是强大的触发因素,表明存在一种独立于视觉数据的偏差机制。为克服这一点,我们提出了一种基于证据响应的视觉信息净化(VIPER)策略,该策略主动过滤掉非基于证据的社会线索,从而强化基于证据的推理。VIPER 减少了谄媚行为,同时保持了可解释性,并持续优于基线方法,为 VLM 的鲁棒和安全整合奠定了必要的基础。
引用
@article{arxiv.2509.21979,
title = {Benchmarking and Mitigating Sycophancy in Medical Vision Language Models},
author = {Juangui Xu and Zikun Guo and Jingwei Lv and Hongbin Lin and Shu Yang and Jun Wen and Di Wang and Lijie Hu},
journal= {arXiv preprint arXiv:2509.21979},
year = {2026}
}
备注
19figures, 61pages. The first two authors contributed equally