中文

Glam:用于乳腿X光多视角的几何引导局部对齐

计算机视觉与模式识别 2025-09-15 v1 人工智能 机器学习

摘要

乳腿X光筛查是早期检测乳腺癌的 essential tool。深度学习方法有望提升乳腿X光的解读速度与准确性。然而,受限于数据量不足及自然图像与医学图像之间的领域差异,开发通用视觉语言模型(VLM)面临瓶颈。现有乳腿X光VLMs常忽视领域特性,如多视角关系。不同于放射科医生会综合分析两侧视图以处理侧旁对应关系,现有方法将其视为独立图像或未能恰当建模多视角对应学习,丢失关键几何语境,导致预测次优。我们提出GLAM:Global and Local Alignment for Multi-view mammography for VLM pretraining using geometry guidance。凭借对乳腿X光多视角成像过程的先验知识,本模型通过联合全局与局部、视觉-视觉与视觉-语言对比学习,学习局部跨视角对齐与精细局部特征。在EMBED[14]等规模最大开放乳腿X光数据集上预训练,本模型在不同数据集上均优于基线方法。

关键词

引用

@article{arxiv.2509.10344,
  title  = {GLAM: Geometry-Guided Local Alignment for Multi-View VLP in Mammography},
  author = {Yuexi Du and Lihui Chen and Nicha C. Dvornek},
  journal= {arXiv preprint arXiv:2509.10344},
  year   = {2025}
}

备注

Accepted by MICCAI 2025