面向视觉语言模型的属性树提示学习
计算机视觉与模式识别
2025-04-22 v2 人工智能
机器学习
摘要
提示学习已证明在适配视觉语言模型以应对下游任务方面效果显著。然而,现有方法通常仅附加带有类别名称的可学习提示标记,以获取文本特征,未能充分利用类别名称中所蕴含的丰富上下文。为此,我们提出了属性树提示学习 (TAP),该方法首先指示 LLM 为每个类别生成一个“概念-属性-描述”结构的属性树,然后学习视觉和文本提示标记以捕获该层次结构。与仅以非结构化描述形式增强类别名称的现有方法不同,我们的方法本质上是从 LLM 中提炼与类别名称相关的结构化知识图谱。此外,我们引入的文本和视觉提示旨在显式学习相应的视觉属性,有效充当领域专家。此外,基于类别名称生成的通用且多样的描述可能在特定图像中错误或缺失。为解决这一对齐问题,我们进一步引入了视觉条件池化模块以提取实例特定的文本特征。大量实验结果表明,我们的方法在零样本从基本到新类的泛化、跨数据集迁移以及 11 个多样化数据集上的少样本分类方面均优于最先进的方法。代码已公开于 https://github.com/HHenryD/TAP。
引用
@article{arxiv.2410.11201,
title = {Tree of Attributes Prompt Learning for Vision-Language Models},
author = {Tong Ding and Wanhua Li and Zhongqi Miao and Hanspeter Pfister},
journal= {arXiv preprint arXiv:2410.11201},
year = {2025}
}