中文

通过判别指导提升3D CT报告生成中细粒度空间定位

计算机视觉与模式识别 2026-04-14 v1

摘要

用于放射学报告生成(RRG)的视觉-语言模型(VLM)可以从体积扫描生成长篇胸部CT报告,并显示出显著的潜力来提高放射学工作流程的效率和一致性。然而,现有方法面临两个关键局限:(i) 训练监督通常较粗糙,将整个CT体与完整的自由文本报告对齐,而不为细粒度属性或病灶位置提供显式对齐;(ii) 评估通常是整体的(词汇重叠、实体匹配或LLM评分),而非针对空间定位进行诊断。我们提出了\emph{判别线索-提示丢弃(DCP-PD)},一个即插即用的框架,从自由文本报告中提取细粒度线索,并将其用于指导报告生成,同时通过提示丢弃缓解捷径依赖。DCP-PD在CT-RATE上实现了最佳性能,将宏观F1分数从=0.501提升至0.603(提高20%),在Rad-ChestCT上实现了显著提升,将F1从0.266提升至0.503(提高89%)。最后,我们引入了一个分层、位置感知的问题集协议(存在→侧位→肺叶)来直接评估病灶位置定位,表明即使是得分高的模型在细粒度空间定位方面仍然具有挑战。

关键词

引用

@article{arxiv.2604.10437,
  title  = {Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance},
  author = {Chenyu Wang and Weicheng Dai and Han Liu and Wenchao Li and Kayhan Batmanghelich},
  journal= {arXiv preprint arXiv:2604.10437},
  year   = {2026}
}