中文

探索大型基础模型在开放词汇HOI检测中的潜力

计算机视觉与模式识别 2024-04-11 v2

摘要

开放词汇的人-物交互(HOI)检测,关注在自然语言引导下检测新颖HOI的问题,对于理解以人为中心的场景至关重要。然而,先前的零样本HOI检测器通常使用相同级别的特征图来建模不同距离的HOI,导致在包含广泛距离的人-物对的场景中性能次优。此外,这些检测器主要依赖类别名称,忽略了语言可以提供的丰富上下文信息,这对于捕捉通常稀有且仅靠类别名称无法很好表示的开放词汇概念至关重要。本文提出一种新颖的端到端开放词汇HOI检测框架,具有条件多级解码和细粒度语义增强(CMD-SE),利用视觉-语言模型(VLM)的潜力。具体来说,通过在二分匹配过程中加入软约束,我们提出用不同级别的特征图建模不同距离的人-物对。此外,利用大型语言模型(LLM)如GPT模型,我们利用其广泛的世界知识为各种交互生成人体部位状态的描述。然后整合人体部位的可泛化和细粒度语义以改进交互识别。在两个数据集SWIG-HOI和HICO-DET上的实验结果表明,我们所提方法在开放词汇HOI检测中达到了最先进的结果。代码和模型见https://github.com/ltttpku/CMD-SE-release。

关键词

引用

@article{arxiv.2404.06194,
  title  = {Exploring the Potential of Large Foundation Models for Open-Vocabulary HOI Detection},
  author = {Ting Lei and Shaofeng Yin and Yang Liu},
  journal= {arXiv preprint arXiv:2404.06194},
  year   = {2024}
}