中文

面向组合零样本学习的语言信息分布提示

计算机视觉与模式识别 2024-07-11 v3

摘要

组合零样本学习(CZSL)任务旨在识别未见的组合视觉概念,例如切片番茄,而模型仅从已见组合(如切片土豆和红色番茄)中学习。得益于对 CLIP 等大型预训练视觉语言模型的提示微调,近期文献展示了比传统基于视觉的方法更优的 CZSL 性能。然而,影响对未见组合泛化的关键方面——包括类上下文的多样性和信息丰富性,以及视觉基元(即状态和物体)之间的纠缠——在现有基于 CLIP 的 CZSL 文献中未得到妥善解决。本文中,我们提出一种通过提示语言信息分布(即 PLID)来处理 CZSL 任务的模型。具体而言,PLID 利用预训练大语言模型(LLM)来(i)构建多样且信息丰富的语言信息类分布,以及(ii)增强类嵌入的组合性。此外,提出视觉-语言基元分解(VLPD)模块,以动态融合来自组合空间和基元空间的分类决策。与现有软提示、硬提示或分布提示文献正交,我们的方法主张提示 LLM 支持的类分布,从而获得更好的零样本泛化。在 MIT-States、UT-Zappos 和 C-GQA 数据集上的实验结果表明 PLID 优于先前方法。我们的代码和模型已发布:https://github.com/Cogito2012/PLID。

关键词

引用

@article{arxiv.2305.14428,
  title  = {Prompting Language-Informed Distribution for Compositional Zero-Shot Learning},
  author = {Wentao Bao and Lichang Chen and Heng Huang and Yu Kong},
  journal= {arXiv preprint arXiv:2305.14428},
  year   = {2024}
}

备注

ECCV 2024 Accepted