中文

面向LLM驱动CT报告生成的差分视觉语义提示

计算机视觉与模式识别 2026-03-19 v1

摘要

尽管大语言模型(LLM)已推动CT报告生成,但现有方法通常对3D体积进行整体编码,无法区分有信息的线索与冗余的解剖背景。灵感来自放射学认知减法,我们提出差分视觉提示(DiffVP),其条件化报告生成基于显式的、高层次的扫描相对参考差异,而非仅依赖绝对视觉特征。DiffVP采用层次化差异提取器捕获全局和局部语义差异并映射到共享潜在空间,同时采用差异到提示生成器将这些信号转化为可学习的视觉前缀标记,用于LLM条件化。这些差异提示作为结构化条件信号,隐式抑制不变解剖,同时放大诊断相关的视觉证据,从而促进准确的报告生成,无需显式病灶定位。在两个大型基准数据集上,DiffVP持续优于先前方法,分别将BLEU-1-4平均提升10.98和4.36,并在RadGenome-ChestCT上进一步提升临床效能(F1分数0.421)。所有代码将在https://github.com/ArielTYH/DiffVP/发布。

关键词

引用

@article{arxiv.2603.17718,
  title  = {DiffVP: Differential Visual Semantic Prompting for LLM-Based CT Report Generation},
  author = {Yuhe Tian and Kun Zhang and Haoran Ma and Rui Yan and Yingtai Li and Rongsheng Wang and Shaohua Kevin Zhou},
  journal= {arXiv preprint arXiv:2603.17718},
  year   = {2026}
}