以大型语言模型为导向的可信医学影像:跨模态幻觉研究
图像与视频处理
2025-08-12 v1 人工智能
计算机视觉与模式识别
摘要
大型语言模型(LLM)正日益被应用于医学影像任务,包括图像解释和合成图像生成。然而,这些模型常会产生幻觉现象,即具信心但错误的输出,可能误导临床决策。本研究从两个方向考察幻觉:一种是图像到文本,即LLM从X光、CT或MRI扫描生成报告;另一种是文本到图像,即模型根据临床提示创建医学影像。我们分析了事实性不一致和解剖学错误等错误,基于专家设定的标准对不同影像模态的输出进行评估。我们的发现表明,解释性和生成性任务中均存在常见的幻觉模式,并对临床可靠性产生深远影响。我们还讨论了导致这些失效的因素,包括模型架构和训练数据。通过系统性地研究图像理解与生成,本工作为改善LLM驱动的医学影像系统的安全性和可信度提供了洞见。
引用
@article{arxiv.2508.07031,
title = {Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities},
author = {Anindya Bijoy Das and Shahnewaz Karim Sakib and Shibbir Ahmed},
journal= {arXiv preprint arXiv:2508.07031},
year = {2025}
}