中文

利用视觉-语言基础模型处理细粒度下游任务

计算机视觉与模式识别 2023-07-14 v1

摘要

视觉-语言基础模型如 CLIP 已在许多任务和数据集上展现出令人印象深刻的零样本性能,尤其是得益于其自由文本输入。然而,它们难以处理某些下游任务,例如细粒度属性检测与定位。本文中,我们提出一种基于正/负提示表述的多任务微调策略,以进一步挖掘视觉-语言基础模型的能力。以 CLIP 架构为基线,我们在鸟类细粒度属性检测与定位任务上展示了显著提升,同时也提高了在 CUB200-2011 数据集上的分类性能。我们提供了用于复现的源代码:可在 https://github.com/FactoDeepLearning/MultitaskVLFM 获取。

关键词

引用

@article{arxiv.2307.06795,
  title  = {Leveraging Vision-Language Foundation Models for Fine-Grained Downstream Tasks},
  author = {Denis Coquenet and Clément Rambour and Emanuele Dalsasso and Nicolas Thome},
  journal= {arXiv preprint arXiv:2307.06795},
  year   = {2023}
}