中文

基于结构观察驱动的图像-文本对比学习用于CT影像报告生成

计算机视觉与模式识别 2026-03-06 v1

摘要

CT影像报告生成(CTRG)旨在自动化临床放射学报告流程,从而减少报告撰写工作负担并促进患者护理。尽管深度学习方法在X光影像报告生成方面取得了显著进展,但其在CTRG中的有效性可能受限于CT图像的更大数据卷量以及更复杂细节的描述需求。本工作引入一种新型两阶段(结构学习与报告学习)框架,专为CTRG设计,具有有效的结构级图像-文本对比功能。在第一阶段,一组可学习的结构特定视觉查询观察CT图像中的相应结构。 resulting observation tokens 与从随附放射学报告中提取的结构特定文本特征进行结构级图像-文本对比损失。在此基础上,提出基于文本-文本相似性的软伪目标以缓解假负样本的影响,即来自非匹配影像和报告中语义上相同的图像结构和文本。因此,模型学习到CT图像与报告之间的结构级语义对应关系。进一步提出一种动态、多样性增强的负样本队列,以引导网络学习区分各种异常结构。在第二阶段,冻结视觉结构查询用于选择描绘每个解剖结构的关键图像块嵌入,最小化来自无关区域的干扰,同时降低内存消耗。此外,添加并训练文本解码器用于报告生成。我们的 extensive 实验表明,该框架在临床效率方面建立了CTRG的新型状态-of-the-art 性能,且其组件均有效。

关键词

引用

@article{arxiv.2603.04878,
  title  = {Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation},
  author = {Hong Liu and Dong Wei and Qiong Peng and Yawen Huang and Xian Wu and Yefeng Zheng and Liansheng Wang},
  journal= {arXiv preprint arXiv:2603.04878},
  year   = {2026}
}

备注

Accept to IPMI 2025