利用文本到图像扩散模型提升人-物交互检测
计算机视觉与模式识别
2023-05-23 v1
摘要
本文研究了当前 HOI(人-物交互)检测方法中存在的问题,并提出了 DiffHOI,一种基于预训练文本-图像扩散模型的新型 HOI 检测方案,其通过改善数据多样性与 HOI 表示来提升检测器性能。我们证明,冻结的文本到图像扩散模型的内部表示空间与动词概念及其对应上下文高度相关。据此,我们提出一种适配器风格的微调方法,从冻结的扩散模型与 CLIP 模型中提取多种语义关联表示,以增强来自预训练检测器的人与物体表示,进一步降低交互预测中的歧义。此外,为填补 HOI 数据集的空白,我们提出 SynHOI,一个类别平衡、大规模且高多样性的合成数据集,包含超过 140K 张具有完整三元组标注的 HOI 图像。它采用自动且可扩展的流水线构建,以扩大多样且高精度的 HOI 标注数据生成规模。SynHOI 能有效缓解现有数据集中的长尾问题,并有助于交互表示的学习。大量实验表明,DiffHOI 在常规检测(即 41.50 mAP)与零样本检测中均显著优于当前最优方法。此外,SynHOI 可提升与模型无关及与骨干网络无关的 HOI 检测性能,尤其在稀有类别上表现出 11.55% mAP 的突出提升。
引用
@article{arxiv.2305.12252,
title = {Boosting Human-Object Interaction Detection with Text-to-Image Diffusion Model},
author = {Jie Yang and Bingliang Li and Fengyu Yang and Ailing Zeng and Lei Zhang and Ruimao Zhang},
journal= {arXiv preprint arXiv:2305.12252},
year = {2023}
}