中文

SCLIP:重新思考密集视觉-语言推理中的自注意力

计算机视觉与模式识别 2024-10-29 v4

摘要

近期对比语言-图像预训练(CLIP)的进展通过在图像层面将视觉表示与目标文本嵌入对齐,展示了强大的零样本分类能力。然而,在密集预测任务中,CLIP通常难以定位图像内的视觉特征,无法给出准确的像素级预测,这阻碍了其作为通用视觉基础模型的功能。本文旨在以最小的预训练模型修改来增强CLIP在语义分割中的潜力。通过重新思考自注意力,我们惊奇地发现,只需引入一种新颖的相关自注意力(CSA)机制,CLIP就能适应密集预测任务。具体而言,我们将CLIP视觉编码器最后一层的传统自注意力模块替换为CSA模块,并重用其预训练的查询、键和值投影矩阵,从而为CLIP的零样本语义分割提供了一种无需训练的适应方法。大量实验展示了CSA的优势:在本文重点关注的八个语义分割基准上,我们获得了38.2%的平均零样本mIoU,显著优于现有SOTA的33.9%和原始CLIP的14.1%。

关键词

引用

@article{arxiv.2312.01597,
  title  = {SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference},
  author = {Feng Wang and Jieru Mei and Alan Yuille},
  journal= {arXiv preprint arXiv:2312.01597},
  year   = {2024}
}

备注

In ECCV 2024