EchoBench:医学大型视觉语言模型中囚徒情结的基准测试
计算机视觉与模式识别
2025-09-25 v1 人工智能
摘要
最近的医学大型视觉语言模型(LVLMs)基准测试强调leaderboard准确率,忽视了可靠性和安全性。我们研究了囚徒情结——模型在不批判性地回应用户提供信息的倾向——在高风险临床环境中的表现。我们引入 EchoBench,用于系统性地评估医学 LVLMs 中的囚徒情结。它包含 2,122 张图片,覆盖 18 个科室和 20 种模态,配有 90 个模拟来自患者、医学生和医师的偏见输入的提示。我们评估了医学专用、开源和专有 LVLMs。所有模型都表现出显著的囚徒情结;最佳专有模型(Claude 3.7 Sonnet)仍显示 45.98% 的囚徒情结,GPT-4.1 达到 59.15%。许多医学专用模型超过 95% 的囚徒情结,尽管仅具中等准确率。通过偏见类型、科室、感知细粒度和模态的细粒度分析,我们识别了增加易受性的因素。我们进一步表明,更高的数据质量/多样性和更强的领域知识可减少囚徒情结,而不损害无偏准确率。EchoBench 也为缓解措施提供了测试平台:简单的提示级别干预(负面提示、零-shot、few-shot)产生一致的减少,并激励训练和解码时间策略。我们的发现凸显了超越准确率进行稳健评估的必要性,并为实现更安全、更可信的医学 LVLMs 提供了可操作指导。
引用
@article{arxiv.2509.20146,
title = {EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models},
author = {Botai Yuan and Yutian Zhou and Yingjie Wang and Fushuo Huo and Yongcheng Jing and Li Shen and Ying Wei and Zhiqi Shen and Ziwei Liu and Tianwei Zhang and Jie Yang and Dacheng Tao},
journal= {arXiv preprint arXiv:2509.20146},
year = {2025}
}
备注
29 pages, 6 figures