中文

通过视觉与语言知识蒸馏实现端到端零样本HOI检测

计算机视觉与模式识别 2022-11-28 v2

摘要

现有的大多数人物交互(HOI)检测方法严重依赖预定义HOI类别的完整标注,这限制了多样性且扩展成本高昂。我们的目标是推进零样本HOI检测,以同时检测已见和未见的人物交互。根本挑战在于发现潜在的人-物对并识别新颖的HOI类别。为克服上述挑战,我们提出了一种新颖的端到端零样本HOI检测(EoID)框架,通过视觉-语言知识蒸馏实现。我们首先设计了一个交互评分模块,结合两阶段二分匹配算法,以动作无关的方式实现对人-物对的交互区分。然后,我们将动作概率分布从预训练的视觉-语言教师模型以及已见的真实标注迁移到HOI模型,以实现零样本HOI分类。在HICO-Det数据集上的大量实验表明,我们的模型能发现潜在的交互对,并能识别未见的HOI。最终,我们的方法在UA设置下,未见mAP上超越先前SOTA 8.92%,总体mAP上超越10.18%;在UC设置下,未见mAP上超越6.02%,总体mAP上超越9.1%。此外,我们的方法可推广到大规模目标检测数据,以进一步扩展动作集。源代码将发布于:https://github.com/mrwu-mac/EoID。

关键词

引用

@article{arxiv.2204.03541,
  title  = {End-to-End Zero-Shot HOI Detection via Vision and Language Knowledge Distillation},
  author = {Mingrui Wu and Jiaxin Gu and Yunhang Shen and Mingbao Lin and Chao Chen and Xiaoshuai Sun},
  journal= {arXiv preprint arXiv:2204.03541},
  year   = {2022}
}