面向零样本组合学习的提示微调
计算机视觉与模式识别
2023-12-06 v1 人工智能
摘要
开放世界组合零样本学习(OW-CZSL)是一项极具挑战性的任务,旨在无任何输出空间先验假设的情况下,识别由已知属性和物体组成的未知组合。为实现该目标,模型须具备“智能”与“知识”。所谓“智能”,是指模型应善于从已知组合中推理属性与物体间的交互;而“知识”则意味着模型拥有面向开放世界的“常识”,能够“预见”未知组合的某些特征。以往大多数工作聚焦于“智能”部分,鲜少提供实现“知识”目标的有效方案。本文提出了一种名为多模态提示微调(MMPT)的框架,以从大型预训练视觉-语言模型中继承“知识”属性。大量实验表明,本文提出的 MMPT 在 OW-CZSL 任务上取得了新的 SOTA 结果。在 UT-Zappos 数据集上,MMPT 将 AUC 分数提升至 ,而此前的最佳分数为 。在更具挑战性的 MIT-States 数据集上,MMPT 的 AUC 分数是当前 SOTA 的 1.5 倍。
引用
@article{arxiv.2312.02191,
title = {Prompt Tuning for Zero-shot Compositional Learning},
author = {Lingyu Zhang and Ting Hua and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2312.02191},
year = {2023}
}