中文

AGA:面向结构化医学跨模态表示学习的自适应组对齐框架

计算机视觉与模式识别 2025-08-01 v1 人工智能 机器学习

摘要

从成对的图像和报告中学习医学视觉表征是表示学习中的一个有前景的方向。然而,当前医学领域的视觉语言预训练方法常常将临床报告简化为单个实体或碎片化标记,忽视了其内在结构。此外,对比学习框架通常依赖大量硬负样本,这在小规模医学数据集上是不可行的。为解决这些挑战,我们提出了自适应组对齐(AGA),一个新的框架,用于从成对的医学图像和报告中捕获结构化语义。AGA引入了基于稀疃相似度矩阵的双向分组机制。对于每一对图像-报告,我们计算文本标记与图像块之间的细粒度相似性。每个标记选择其最匹配的图像块以形成视觉组,每个图像块选择其最相关的标记以形成语言组。为实现自适应分组,我们设计了两个阈值门控模块,称为语言分组阈值门控和视觉分组阈值门控,这些模块会动态学习分组阈值。基于相似度得分计算组表示。为将每个标记与其组表示对齐,我们引入了基于实例的组对齐损失,该损失在每个图像-文本对内工作,无需外部负样本。最后,应用双向跨模态分组对齐模块以增强视觉和语言组表示之间的细粒度对齐。在公开和私有数据集上的大量实验表明,我们的方法在图像-文本检索和分类任务中表现出色,无论是微调还是零样本设置。

关键词

引用

@article{arxiv.2507.23402,
  title  = {AGA: An adaptive group alignment framework for structured medical cross-modal representation learning},
  author = {Wei Li and Xun Gong and Jiao Li and Xiaobin Sun},
  journal= {arXiv preprint arXiv:2507.23402},
  year   = {2025}
}