重新定义零样本人物-物体互动检测:基于 CLIP 的生成方法 HOIGen
计算机视觉与模式识别
2024-08-13 v1
摘要
零样本人物-物体互动(HOI)检测器能够对训练期未遇到的 HOI 类别进行泛化。受 CLIP 提供的惊人零样本能力的启发,最新方法致力于利用 CLIP 嵌入来提升零样本 HOI 检测。然而,这些基于嵌入的方法仅在已见类别上训练分类器,导致推理时出现已见-未见混淆。此外,我们发现使用 prompt-tuning 和 adapters 会进一步加大已见与未见准确率之间的差距。为解决这一挑战,我们提出了首个基于 CLIP 的生成式零样本 HOI 检测模型,称为 HOIGen。它允许将 CLIP 的潜力从特征提取扩展到特征生成。为实现此目标,我们按照人、物和联合特征的生成,开发了注入 CLIP 的特征生成器。随后,我们提取已见样本的真实特征并与合成特征混合,使模型能在联合训练中处理已见与未见类别。为丰富 HOI 分数,我们分别在基于成对 HOI 识别的分支中构建生成原型库,以及在基于图像的 HOI 识别分支中构建多知识原型库。大量实验表明,HOIGen 在 HICO-DET 数据集上在各种零样本设置下均优于其他顶尖方法,在已见与未见类别上均实现卓越性能。代码已公开:https://github.com/soberguo/HOIGen
引用
@article{arxiv.2408.05974,
title = {Unseen No More: Unlocking the Potential of CLIP for Generative Zero-shot HOI Detection},
author = {Yixin Guo and Yu Liu and Jianghao Li and Weimin Wang and Qi Jia},
journal= {arXiv preprint arXiv:2408.05974},
year = {2024}
}
备注
Accepted by ACM MM 2024