中文

GEN-VLKT:简化关联并增强交互理解的人-物交互检测

计算机视觉与模式识别 2022-04-15 v2 人工智能

摘要

人-物交互(HOI)检测任务可分为两个核心问题,即人-物关联与交互理解。本文从这两个方面揭示并解决了传统查询驱动HOI检测器的缺陷。在关联方面,以往的双分支方法存在复杂且昂贵的后匹配问题,而单分支方法忽略了不同任务中的特征区分。我们提出引导嵌入网络(GEN)以实现无后匹配的双分支流程。在GEN中,我们设计了一个实例解码器,用两个独立的查询集检测人和物体,并设计了一个位置引导嵌入(p-GE)来将同一位置的人和物体标记为一对。此外,我们设计了一个交互解码器来对交互进行分类,其中交互查询由来自每个实例解码器层输出生成的实例引导嵌入(i-GE)构成。在交互理解方面,以往方法受长尾分布和零样本发现的困扰。本文提出一种视觉-语言知识迁移(VLKT)训练策略,通过从视觉-语言预训练模型CLIP迁移知识来增强交互理解。具体而言,我们用CLIP提取所有标签的文本嵌入以初始化分类器,并采用模仿损失来最小化GEN与CLIP之间的视觉特征距离。结果表明,GEN-VLKT在多个数据集上大幅优于当前最优方法,例如在HICO-Det上提升5.05 mAP。源代码见 https://github.com/YueLiao/gen-vlkt。

关键词

引用

@article{arxiv.2203.13954,
  title  = {GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI Detection},
  author = {Yue Liao and Aixi Zhang and Miao Lu and Yongliang Wang and Xiaobo Li and Si Liu},
  journal= {arXiv preprint arXiv:2203.13954},
  year   = {2022}
}

备注

CVPR 2022