中文

面向零样本组合学习的提示微调

计算机视觉与模式识别 2023-12-06 v1 人工智能

摘要

开放世界组合零样本学习(OW-CZSL)是一项极具挑战性的任务,旨在无任何输出空间先验假设的情况下,识别由已知属性和物体组成的未知组合。为实现该目标,模型须具备“智能”与“知识”。所谓“智能”,是指模型应善于从已知组合中推理属性与物体间的交互;而“知识”则意味着模型拥有面向开放世界的“常识”,能够“预见”未知组合的某些特征。以往大多数工作聚焦于“智能”部分,鲜少提供实现“知识”目标的有效方案。本文提出了一种名为多模态提示微调(MMPT)的框架,以从大型预训练视觉-语言模型中继承“知识”属性。大量实验表明,本文提出的 MMPT 在 OW-CZSL 任务上取得了新的 SOTA 结果。在 UT-Zappos 数据集上,MMPT 将 AUC 分数提升至 29.829.8,而此前的最佳分数为 26.526.5。在更具挑战性的 MIT-States 数据集上,MMPT 的 AUC 分数是当前 SOTA 的 1.5 倍。

关键词

引用

@article{arxiv.2312.02191,
  title  = {Prompt Tuning for Zero-shot Compositional Learning},
  author = {Lingyu Zhang and Ting Hua and Yilin Shen and Hongxia Jin},
  journal= {arXiv preprint arXiv:2312.02191},
  year   = {2023}
}