中文

通过视觉 - 语言集成迈向零样本人 - 物交互检测

计算机视觉与模式识别 2024-03-13 v1

摘要

人 - 物交互 (HOI) 检测旨在定位图像中的人 - 物对并识别其交互类别。大多数现有方法主要关注监督学习,这依赖于大量的人工 HOI 标注。在本文中,我们提出了一种名为 KI2HOI (Knowledge Integration to HOI) 的新框架,该框架有效整合视觉 - 语言模型的知识以改进零样本 HOI 检测。具体而言,动词特征学习模块基于视觉语义设计,通过采用动词提取解码器将相应的动词查询转换为特定交互的类别表示。我们开发了一种有效的加法自注意力机制以生成更全面的视觉表示。此外,创新的交互表示解码器通过交叉注意力机制整合空间和视觉特征信息,有效提取信息丰富的区域。为了应对低数据量下的零样本学习,我们利用来自 CLIP 文本编码器的先验知识来初始化线性分类器,以增强对交互的理解。在主流 HICO-DET 和 V-COCO 数据集上进行的大量实验表明,我们的模型在各种零样本和全监督设置下均优于以往方法。

关键词

引用

@article{arxiv.2403.07246,
  title  = {Towards Zero-shot Human-Object Interaction Detection via Vision-Language Integration},
  author = {Weiying Xue and Qi Liu and Qiwei Xiong and Yuxiao Wang and Zhenao Wei and Xiaofen Xing and Xiangmin Xu},
  journal= {arXiv preprint arXiv:2403.07246},
  year   = {2024}
}