面向轻量级语义分割的 CLIP
计算机视觉与模式识别
2023-10-12 v1
摘要
在 4 亿图文对上训练的大规模预训练模型 CLIP 为处理视觉任务提供了一种有前景的范式,尽管其仅在图像级别上。后续工作,如 DenseCLIP 和 LSeg,将这一范式扩展到密集预测,包括语义分割,并取得了优异结果。然而,上述方法要么依赖 CLIP 预训练的视觉骨干,要么使用未预训练但沉重的骨干如 Swin,且在应用于轻量级骨干时效果不佳。原因在于轻量级网络的特征提取能力相对有限,难以将图像特征与文本嵌入完美对齐。在本工作中,我们提出一种新的特征融合模块来解决该问题,并使语言引导范式能够应用于轻量级网络。具体而言,该模块为 CNN 与 transformer 的并行设计,二者之间具有双向桥接:CNN 从图像编码器提取特征图的空间信息与视觉上下文,transformer 将文本编码器的文本嵌入向前传播。该模块的核心是通过桥接对视觉与文本特征进行双向融合,从而促进它们在嵌入空间中的接近与对齐。该模块与模型无关,不仅能使语言引导的轻量级语义分割切实可行,还能充分利用语言先验的预训练知识,并无论视觉骨干如何都取得优于此前 SOTA 工作(如 DenseCLIP)的性能。我们进行了大量实验以证明所提方法的优越性。
引用
@article{arxiv.2310.07394,
title = {CLIP for Lightweight Semantic Segmentation},
author = {Ke Jin and Wankou Yang},
journal= {arXiv preprint arXiv:2310.07394},
year = {2023}
}