中文

RadFlag:医学视觉语言模型的黑盒幻觉检测方法

计算机视觉与模式识别 2024-11-19 v2 机器学习

摘要

从医学图像生成准确的放射学报告是临床重要但具有挑战性的任务。虽然当前的视觉语言模型(VLM)在这方面表现出色,但它们容易产生幻觉,可能危及患者护理。我们引入 RadFlag,一种增强放射学报告生成准确性的黑盒方法。我们的方法使用基于抽样的标记技术来发现应该被删除的幻觉生成。我们首先在不同温度下对多个报告进行抽样,然后使用大语言模型(LLM)识别那些在不同抽样结果中不被一致支持的主张,这表明该模型对这些主张的信心较低。通过校准阈值,我们将其中一部分主张标记为可能的幻觉,应进行额外审查或自动拒绝。我们的方法在识别单个幻觉句子以及包含幻觉的报告时实现了高精度。作为一种易于使用的黑盒系统,仅需访问模型的温度参数,RadFlag 可与广泛的放射学报告生成模型兼容,具有潜在的广泛提高自动化放射学报告质量的能力。

关键词

引用

@article{arxiv.2411.00299,
  title  = {RadFlag: A Black-Box Hallucination Detection Method for Medical Vision Language Models},
  author = {Serena Zhang and Sraavya Sambara and Oishi Banerjee and Julian Acosta and L. John Fahrner and Pranav Rajpurkar},
  journal= {arXiv preprint arXiv:2411.00299},
  year   = {2024}
}

备注

17 pages, 6 figures