中文

面向视觉定位医学报告生成的自监督解剖一致性学习

计算机视觉与模式识别 2025-10-01 v1

摘要

视觉定位医学报告生成旨在生成医学图像的临床准确描述,并以明确的视觉证据为锚点,以提高可解释性并促进其融入临床工作流程。然而,现有方法通常依赖单独训练的检测模块,需要大量专家标注,带来了高昂的标注成本,并因数据集间的病理分布偏差而限制了泛化能力。为应对这些挑战,我们提出了自监督解剖一致性学习——一种新颖且无需标注的框架,该框架使用简单的文本提示将生成的报告与对应的解剖区域对齐。SS-ACL 受人体解剖结构自上而下不变的包含关系启发,构建了一个层次化解剖图,按空间位置组织实体。它递归地重建细粒度解剖区域以强制执行样本内空间对齐,从而内在地引导注意力图关注文本提示的视觉相关区域。为进一步增强异常识别的样本间语义对齐,SS-ACL 引入了一种基于解剖一致性的区域级对比学习。这些对齐的嵌入作为报告生成的先验,使注意力图能够提供可解释的视觉证据。大量实验表明,不依赖专家标注的 SS-ACL (i) 生成了准确且视觉定位的报告——在词汇准确率上比 SOTA 方法高出 10%,在临床有效性上高出 25%,并且 (ii) 在各种下游视觉任务中取得了有竞争力的性能,在零样本视觉定位上比当前领先的视觉基础模型高出 8%。

关键词

引用

@article{arxiv.2509.25963,
  title  = {Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation},
  author = {Longzhen Yang and Zhangkai Ni and Ying Wen and Yihang Liu and Lianghua He and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2509.25963},
  year   = {2025}
}