中文

通用医学短语定位

计算机视觉与模式识别 2025-12-11 v2 计算与语言

摘要

医学短语定位(MPG)将放射学发现的文本描述映射到相应的图像区域。这些定位后的报告对于非专业人士来说尤其容易解释。现有的MPG系统大多遵循指代表达理解(REC)范例,仅返回每个短语的一个边界框。然而,真实报告常常违反这一假设。它们包含多区域发现、非诊断性文本,以及不可定位的短语,如否定词或正常解剖的描述。为此,我们将任务重新定义为通用医学短语定位(GMPG),即每个句子映射到零个、一个或多个评分区域。为实现这一表述,我们引入了第一个GMPG模型:MedGrounder。我们采用两阶段训练方案:在报告句子-解剖框对齐的数据集上进行预训练,在报告句子-人工标注框数据集上进行微调。在PadChest-GR和MS-CXR上的实验表明,MedGrounder在零样本迁移方面取得了强大的成绩,在多区域和不可定位短语方面超过REC风格和定位报告生成基线,同时使用了远少于人工框注释。最后,我们展示MedGrounder可以与现有的报告生成器组合,无需重新训练生成器即可生成定位报告。

关键词

引用

@article{arxiv.2512.01085,
  title  = {Generalised Medical Phrase Grounding},
  author = {Wenjun Zhang and Shekhar S. Chandra and Aaron Nicolson},
  journal= {arXiv preprint arXiv:2512.01085},
  year   = {2025}
}

备注

10 pages