中文

DRPT:面向组合零样本学习的解耦循环提示微调

计算机视觉与模式识别 2023-05-03 v1 人工智能

摘要

组合零样本学习(CZSL)旨在识别由已知知识组合而成、无训练样本的新概念。标准 CZSL 要么识别视觉基元,要么增强未见组合实体,因而状态与对象基元间的纠缠无法被充分利用。诚然,视觉-语言模型(VLMs)可通过提示微调自然应对 CZSL,但不均衡的纠缠会使提示陷入局部最优。本文进一步引入一种称为 DRPT 的新颖解耦循环提示微调框架,以更好挖掘 VLMs 在 CZSL 中的潜力。具体而言,状态与对象基元被视为嵌入提示中的可学习词汇标记,并在所见组合上微调。我们并非联合微调状态与对象,而是设计一种解耦循环微调策略以抑制纠缠引起的牵引力并逐步优化标记参数,从而得到更优提示空间。值得注意的是,我们提出渐进式微调流程,允许对提示进行增量更新,先优化对象再优化状态,反之亦然。同时,状态与对象的优化相互独立,从而可学习更清晰特征以进一步缓解纠缠误导优化问题。此外,我们量化并分析了 CZSL 中的纠缠,并补充纠缠再平衡优化方案。DRPT 在大量基准数据集上超越代表性最优方法,在准确率与效率上均展现优越性。

关键词

引用

@article{arxiv.2305.01239,
  title  = {DRPT: Disentangled and Recurrent Prompt Tuning for Compositional Zero-Shot Learning},
  author = {Xiaocheng Lu and Ziming Liu and Song Guo and Jingcai Guo and Fushuo Huo and Sikai Bai and Tao Han},
  journal= {arXiv preprint arXiv:2305.01239},
  year   = {2023}
}