中文

EZ-HOI:基于引导式提示学习的视觉语言模型适配用于零样本人体-对象交互检测

计算机视觉与模式识别 2024-12-20 v3

摘要

在零样本设置下检测人体-对象交互(HOI),模型必须处理未见类的问题,这具有挑战性。现有方法依赖将视觉编码器与大型视觉语言模型(VLM)对齐以利用其广泛知识,需要大型计算密集型模型且存在训练难题。基于提示学习适应VLM是一种直接对齐的替代方案。然而,针对特定任务数据集进行微调常导致对已见类的过拟合,因缺乏未见类标签而在未见类上的性能次优。为解决这些挑战,我们提出一种 novel 的基于提示学习的框架,用于高效零样本 HOI 检测(EZ-HOI)。首先,我们引入大型语言模型(LLM)和 VLM 的指导,用于可学习的提示,整合详细的 HOI 描述和视觉语义以适应 HOI 任务。然而,由于训练数据集仅包含已见类标签,对此类数据集上的 VLM 微调倾向于为已见类优化可学习提示而非未见类。因此,我们设计针对未见类的提示学习方案,利用相关已见类的信息,并通过 LLM 突出显示未见类与相关已见类之间的差异。定量评估表明,我们的 EZ-HOI 在各种零样本设置下实现了最先进的性能,其可训练参数仅为现有方法的 10.35% 至 33.95%。代码已公开:https://github.com/ChelsieLei/EZ-HOI。

关键词

引用

@article{arxiv.2410.23904,
  title  = {EZ-HOI: VLM Adaptation via Guided Prompt Learning for Zero-Shot HOI Detection},
  author = {Qinqian Lei and Bo Wang and Robby T. Tan},
  journal= {arXiv preprint arXiv:2410.23904},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024