Look & Mark:在多模态大语言模型中利用放射科医生眼注视与边界框生成胸片报告
计算机视觉与模式识别
2025-05-29 v1 计算与语言
摘要
多模态大语言模型(LLM)的最新进展显著提升了医学图像分析的自动化水平,尤其是在根据胸部 X 射线(CXR)生成放射学报告方面。然而,这些模型仍存在幻觉与具有临床意义的错误,限制了其在实际应用中的可靠性。在本研究中,我们提出了 Look & Mark (L&M),一种新颖的定位注视策略,将放射科医生眼注视与边界框标注整合到 LLM 提示框架中。与常规微调不同,L&M 利用上下文学习在不重新训练的情况下实现显著的性能提升。在多个领域专用模型与通用模型上的评估表明,L&M 取得了显著提升,包括与基线提示相比,CXR-LLaVA 的总体指标(A.AVG)提升了 1.2%,LLaVA-Med 提升了高达 9.2%。通用模型同样受益于 L&M 与上下文学习的结合,其中 LLaVA-OV 达到了 87.3% 的临床平均性能(C.AVG)——在所有模型中最高,甚至超越了那些专为 CXR 报告生成而训练的模型。专家评估进一步证实,L&M 减少了具有临床意义的错误(平均每份报告减少 0.43 个错误),如错误预测与遗漏,从而提升了准确性与可靠性。这些发现凸显了 L&M 作为 AI 辅助放射学的可扩展高效解决方案的潜力,为改善低资源临床环境中的诊断工作流程铺平了道路。
引用
@article{arxiv.2505.22222,
title = {Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation},
author = {Yunsoo Kim and Jinge Wu and Su-Hwan Kim and Pardeep Vasudev and Jiashu Shen and Honghan Wu},
journal= {arXiv preprint arXiv:2505.22222},
year = {2025}
}