中文

ICPC:用于语义分割的实例条件提示与对比学习框架

计算机视觉与模式识别 2023-08-15 v1

摘要

现代监督语义分割方法通常基于在 ImageNet 上预训练的监督或自监督模型进行微调。近期工作表明,通过提示学习将 CLIP 的知识迁移至语义分割可取得令人满意的性能。性能提升源于多模态对齐的特征增强,即视觉与文本嵌入的点积。然而,如何改进密集任务中多模态对齐以获得更好迁移性能仍鲜有探索。本工作中,我们着眼于从提示设计与损失函数两方面提升视觉-文本对齐质量,提出实例条件提示与对比学习(ICPC)框架。首先,相较静态提示设计,我们揭示基于图像内容条件的动态提示能更高效利用文本编码器处理复杂密集任务。其次,提出对齐引导对比损失以精炼视觉与文本嵌入的对齐。进一步提出轻量多尺度对齐以提升性能。在三个大规模数据集(ADE20K、COCO-Stuff10k 和 ADE20K-Full)上的大量实验表明,ICPC 在不同骨干网络上均带来一致提升。以 ResNet-50 为例,ICPC 在三个数据集上分别优于最优同类方法 1.71%、1.05% 和 1.41% mIoU。

关键词

引用

@article{arxiv.2308.07078,
  title  = {ICPC: Instance-Conditioned Prompting with Contrastive Learning for Semantic Segmentation},
  author = {Chaohui Yu and Qiang Zhou and Zhibin Wang and Fan Wang},
  journal= {arXiv preprint arXiv:2308.07078},
  year   = {2023}
}