中文

利用CLIP进行零样本HOI检测需在多层次进行知识蒸馏

计算机视觉与模式识别 2023-09-12 v1

摘要

本文中,我们研究零样本人-物交互(HOI)检测任务,这是一种无需任务特定标注即可识别HOI的新范式。为应对这一挑战性任务,我们采用大规模预训练视觉-语言模型(VLM)CLIP,用于多层次的知识蒸馏。具体而言,我们设计了一个多分支神经网络,利用CLIP在各层次学习HOI表示,包括全局图像、涵盖人-物对的局部并集区域,以及人或物体的独立实例。为训练模型,利用CLIP生成全局图像与局部并集区域的HOI分数作为监督信号。大量实验证明了我们新颖的多层次CLIP知识集成策略的有效性。值得注意的是,该模型取得了强劲性能,甚至在公开HICO-DET基准上可与某些全监督与弱监督方法相媲美。

关键词

引用

@article{arxiv.2309.05069,
  title  = {Exploiting CLIP for Zero-shot HOI Detection Requires Knowledge Distillation at Multiple Levels},
  author = {Bo Wan and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2309.05069},
  year   = {2023}
}