HalluCXR: 医学视觉语言模型胸部放射图解读中的幻觉基准测试与缓解
计算机视觉与模式识别
2026-05-21 v1
摘要
视觉语言模型 (VLM) 正在越来越多地用于医学图像解读,但它们经常会产生幻觉,即生成临床上看起来合理但事实上错误的发现,这种情况会直接危及患者安全。我们提出 HalluCXR,一个评估六种结构多样的视觉语言模型在 856 份分层抽样的 MIMIC-CXR 胸部X光片和三种查询类型上的表现,共进行 15,408 次模型评估。我们构建了一个包含八个类别的幻觉分类体系,配以临床严重程度评分,并开发了两层检测管线,通过 250 份人工标注进行验证(自动检测 F1=0.959;LLM 评判 F1=0.907)。我们发现 61.9%--82.3% 的输出包含幻觉,其中最高可达 80.2% 的错误属于临床危险级别。提炼出三个关键模式:正常放射图反而吸引最多的严重幻觉,常见发现被系统性地过度制造,而罕见发现则未被充分检测到,响应长度本身即可预测幻觉风险(AUC 最高达 0.908)。六模型集成可将制造错误降低最高 84.8%,代价是增加漏检;三模型子集在性能相当的情况下仅需一半成本。这些结果表明,幻觉审计、基于 verbosity 的风险监控以及基于集成的安全层是临床部署的必要条件。
引用
@article{arxiv.2605.20469,
title = {HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation},
author = {Haoyu Wang and Zitong Li},
journal= {arXiv preprint arXiv:2605.20469},
year = {2026}
}