医学视觉-语言模型的视觉对齐用于基于视觉的放射学报告生成
计算机视觉与模式识别
2026-03-16 v2
摘要
放射学报告生成(RRG)是实现医疗工作流自动化、促进准确患者评估以及减轻医疗专业人员工作负担的关键步骤。尽管大型医学视觉-语言模型(Med-VLMs)取得了近期进展,但生成既具有视觉基础又具有临床准确性的放射学报告仍然是一个重大挑战。现有方法通常依赖大规模标注语料进行预训练、昂贵的任务特定偏好数据或基于检索的知识。然而,这些策略无法充分缓解因视觉和语言表征之间跨模态对齐不良而产生的幻觉。为解决这些局限性,我们提出 VALOR:面向基于视觉的放射学报告生成的医学视觉-语言模型视觉对齐(VALOR: Visual Alignment of Medical Vision-Language Models for GrOunded Radiology Report Generation),通过两个互补的推理阶段解决视觉幻觉问题:(1)临床引导的文本推理通过可验证的自然语言和临床指标奖励引导模型,生成语义完整且使用精确医学术语的报告。(2)自监督视觉推理利用一个冻结的领域专家计算输入胸部 X 光片与生成候选之间的图像-文本相似度分数,将其转换为秩归一化的优势值,明确引导策略朝向视觉对齐的输出,无需偏好对、检索数据库或额外标注。在多个基准上的广泛实验表明,VALOR 显著提升了生成质量以及视觉对齐的临床准确性,在最先进的医学报告生成基准上实现了显著的性能提升。
引用
@article{arxiv.2512.16201,
title = {Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation},
author = {Sarosij Bose and Ravi K. Rajendran and Biplob Debnath and Konstantinos Karydis and Amit K. Roy-Chowdhury and Srimat Chakradhar},
journal= {arXiv preprint arXiv:2512.16201},
year = {2026}
}