中文

将文本作为图像用于多标签图像识别中的提示调优

计算机视觉与模式识别 2022-12-21 v2

摘要

提示调优已被用作在数据有限或标签有限场景下将大型视觉-语言预训练模型(如 CLIP)适配到各种下游任务的高效方式。然而,现有方法中学习提示默认以视觉数据(如图像)为前提。在这项工作中,我们主张图像-文本对比学习在对齐两模态(用于训练 CLIP)方面的有效性进一步使得将文本作为图像进行提示调优成为可能,并引入了 TaI 提示。与视觉数据相比,文本描述易于收集,且其类别标签可直接导出。特别地,我们将 TaI 提示应用于多标签图像识别,其中真实场景中的句子作为图像的替代用于提示调优。此外,借助 TaI,进一步提出了双粒度提示调优(TaI-DPT),以提取粗粒度与细粒度嵌入来增强多标签识别性能。实验结果表明,我们提出的 TaI-DPT 在多个基准(如 MS-COCO、VOC2007 和 NUS-WIDE)上大幅优于零样本 CLIP,同时它可与现有基于图像提示的方法结合以进一步提升识别性能。代码发布于 https://github.com/guozix/TaI-DPT。

关键词

引用

@article{arxiv.2211.12739,
  title  = {Texts as Images in Prompt Tuning for Multi-Label Image Recognition},
  author = {Zixian Guo and Bowen Dong and Zhilong Ji and Jinfeng Bai and Yiwen Guo and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2211.12739},
  year   = {2022}
}