中文

TIER:面向CLIP风格模型的文本-图像熵正则化

机器学习 2023-03-01 v2 计算机视觉与模式识别

摘要

在本文中,我们介绍一种针对对比语言-图像预训练(CLIP)医学视觉模型的正则化新方案。我们的方法基于如下观察:在许多医学影像任务中,文本标记应仅描述少量图像区域,同样,每个图像区域应仅对应少数文本标记。在CLIP风格模型中,这意味着对于给定的图像-文本对,文本标记嵌入应仅与少量图像块嵌入具有高相似度。我们使用一种新颖的正则化方案将这一观察形式化,该方案惩罚文本标记到图像块相似度分数的熵。我们从定性和定量上证明,所提出的正则化方案将大多数成对的文本标记与图像块相似度分数收缩至零,从而实现期望的效果。我们在胸片这一重要的医学场景中展示了我们方法的前景,其中潜在的稀疏性假设自然成立。使用我们提出的方法,我们在CheXpert和Padchest胸片数据集上取得了最先进(SOTA)的平均零样本性能,优于该模型的未正则化版本及若干近期发布的自监督模型。

关键词

引用

@article{arxiv.2212.06710,
  title  = {TIER: Text-Image Entropy Regularization for CLIP-style models},
  author = {Anil Palepu and Andrew L. Beam},
  journal= {arXiv preprint arXiv:2212.06710},
  year   = {2023}
}

备注

Submitted to CHIL 2023 conference