中文

卷积难以取代:基于单一冻结卷积 CLIP 的开放词汇分割

计算机视觉与模式识别 2023-11-16 v2

摘要

开放词汇分割是一项具有挑战性的任务,要求对开放类别集合中的物体进行分割与识别。应对该挑战的一种方法是利用多模态模型(如 CLIP)在共享嵌入空间中提供图像与文本特征,从而弥合封闭词汇与开放词汇识别之间的鸿沟。因此,现有方法常采用两阶段框架解决问题:输入先经过掩码生成器,再与预测掩码一起通过 CLIP 模型。此过程涉及多次从图像中提取特征,可能低效且效果不佳。相比之下,我们提出使用共享的冻结卷积 CLIP 骨干网络将所有组件构建为单阶段框架,不仅显著简化了当前两阶段流程,还卓越地实现了更优的精度-成本权衡。所提出的 FC-CLIP 得益于以下发现:冻结的 CLIP 骨干维持开放词汇分类能力且可充当强掩码生成器,卷积 CLIP 相比于对比图文预训练时所用分辨率能更好地泛化至更大输入分辨率。仅在 COCO panoptic 数据上训练并以零样本方式测试时,FC-CLIP 在 ADE20K 上取得 26.8 PQ、16.8 AP 和 34.1 mIoU,在 Mapillary Vistas 上取得 18.2 PQ、27.9 mIoU,在 Cityscapes 上取得 44.0 PQ、26.8 AP、56.2 mIoU,分别优于先前最佳方法 +4.2 PQ、+2.4 AP、+4.2 mIoU(ADE20K),+4.0 PQ(Mapillary Vistas)和 +20.1 PQ(Cityscapes)。此外,FC-CLIP 的训练与测试时间分别比同一先前最佳方法快 7.5 倍和 6.6 倍,同时参数量减少 5.9 倍。FC-CLIP 还在多个开放词汇语义分割数据集上确立了新的最先进性能。代码见 https://github.com/bytedance/fc-clip

关键词

引用

@article{arxiv.2308.02487,
  title  = {Convolutions Die Hard: Open-Vocabulary Segmentation with Single Frozen Convolutional CLIP},
  author = {Qihang Yu and Ju He and Xueqing Deng and Xiaohui Shen and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2308.02487},
  year   = {2023}
}

备注

NeurIPS 2023 camera ready. code and model available at https://github.com/bytedance/fc-clip