中文

HOLa:面向零样态 HOI 检测的低秩分解型 VLM 特征适配

计算机视觉与模式识别 2025-08-05 v2

摘要

零样态人体-物体交互 (HOI) 检测仍是一项具有挑战性的任务,尤其在针对未见动作方面表现有限。现有方法通过调用视觉语言模型 (VLM) 以获取训练数据之外的知识,但要么难以区分涉及相同物体的动作,要么对未见类别的泛化能力有限。本文引入 HOLa(Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation),一种新方法既提升了对未见类别的泛化能力,又改进了动作区分能力。在训练过程中,HOLa 通过低秩分解对给定 HOI 类别的文本特征进行分解,生成类别共享的基准特征和可适应权重。这些特征和权重构成紧凑的 HOI 表示,保留跨类别的共享信息,从而增强对未见类别的泛化能力。随后,通过为每个 HOI 类别适配权重并引入人体-物体标记来丰富视觉交互表示,以改进动作区分。为进一步区分未见动作,我们引导权重适配引入来自大语言模型 (LLM) 的动作正则化。实验结果表明,我们的方法在 HICO-DET 上的零样态 HOI 设置下取得最新状态,未见动作 mAP 可达 27.91。代码已开源于 https://github.com/ChelsieLei/HOLa

关键词

引用

@article{arxiv.2507.15542,
  title  = {HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation},
  author = {Qinqian Lei and Bo Wang and Robby T. Tan},
  journal= {arXiv preprint arXiv:2507.15542},
  year   = {2025}
}

备注

Accepted by ICCV 2025