中文

FaNe:面向细粒度跨模态对比的假负样本消除与文本条件稀疏注意力

计算机视觉与模式识别 2025-11-18 v1

摘要

医学视觉语言预训练 (VLP) 具有显著潜力,旨在通过利用配对图像-报告数据来推进医学图像理解。然而,现有方法受限于由语义相似文本诱导的 Fa}alse Negatives (FaNe) 以及不足的细粒度跨模态对齐。为解决这些限制,我们提出 FaNe,一个语义增强的 VLP 框架。为缓解假负样本,我们引入基于文本-文本相似性的语义感知正样本挖掘策略,并采用自适应归一化。此外,我们设计了文本条件稀疏注意力池化模块,通过受文本线索引导的局部视觉表示实现细粒度图像-文本对齐。为加强单模态内判别性,我们开发了基于硬负样本的对比损失,自适应重加权语义相似的负样本。广泛的下游医学影像基准测试结果表明,FaNe 在图像分类、目标检测和语义分割等任务上实现了最先进的性能,验证了该框架的有效性。

关键词

引用

@article{arxiv.2511.12215,
  title  = {FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention},
  author = {Peng Zhang and Zhihui Lai and Wenting Chen and Xu Wu and Heng Kong},
  journal= {arXiv preprint arXiv:2511.12215},
  year   = {2025}
}

备注

AAAI 2026