HOICLIP:利用视觉-语言模型实现高效知识迁移的 HOI 检测
计算机视觉与模式识别
2023-07-27 v3
摘要
人-物交互(HOI)检测旨在定位人-物对并识别其交互。近来,对比语言-图像预训练(CLIP)通过知识蒸馏为 HOI 检测器提供交互先验展现出巨大潜力。然而,此类方法常依赖大规模训练数据,且在少样本/零样本场景下性能不佳。本文提出一种新颖的 HOI 检测框架,可高效从 CLIP 中提取先验知识并取得更好泛化性。具体而言,我们首先引入一种新颖的交互解码器,通过交叉注意力机制从 CLIP 的视觉特征图中提取信息区域,随后由知识融合模块与检测骨干网络融合,以实现更准确的人-物对检测。此外,利用 CLIP 文本编码器中的先验知识,通过嵌入 HOI 描述生成分类器。为区分细粒度交互,我们通过视觉语义算术与轻量级动词表示适配器从训练数据构建动词分类器。进一步,我们提出一种无需训练的增强方法,以利用 CLIP 的全局 HOI 预测。大量实验表明,我们的方法在各种设定下大幅优于当前最优,例如在 HICO-Det 上 mAP 提升 4.04。源代码见 https://github.com/Artanic30/HOICLIP。
引用
@article{arxiv.2303.15786,
title = {HOICLIP: Efficient Knowledge Transfer for HOI Detection with Vision-Language Models},
author = {Shan Ning and Longtian Qiu and Yongfei Liu and Xuming He},
journal= {arXiv preprint arXiv:2303.15786},
year = {2023}
}
备注
CVPR 2023.Open sourced, Code and Model Available