LLM-引导的面向事实的 MLLM-based 医学报告生成中的目标查找指导
计算与语言
2026-03-03 v1 计算机视觉与模式识别
摘要
利用多模态大语言模型(MLLM)自动生成医学报告时,常常会遇到事实不稳定的问题,这可能表现为发现被遗漏或包含不准确信息,从而限制了其在临床环境中的应用。当前方法通常直接基于图像特征生成报告,这本质上缺乏明确的事实依据。为此,我们提出了 Fact-Flow,一种创新的框架,将视觉事实识别与报告生成过程分离。这一过程通过首先从图像预测临床发现,然后引导 MLLM 生成事实精确的报告。我们方法的关键创新是利用大语言模型(LLM)自主创建标注医学发现的数据集,有效消除了昂贵的手动标注需求。在两个以疾病为焦点的医学数据集上进行的大量实验评估表明,我们方法的有效性,显著提升了与最先进模型相比的事实准确性,同时保持了高标准的文本质量。
引用
@article{arxiv.2603.00426,
title = {LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation},
author = {Cunyuan Yang and Dejuan Song and Xiaotao Pang and Qianqian Shen and Wenjie Nie and Yifan Huang and Lei Wu and Wei Han and Haishuai Wang and Jiajun Bu},
journal= {arXiv preprint arXiv:2603.00426},
year = {2026}
}
备注
10 pages, 1 figure