ViPLO:基于Vision Transformer的姿态条件自环图用于人-物交互检测
计算机视觉与模式识别
2023-04-18 v1
摘要
人-物交互(HOI)检测通过定位并推断人与物体间的关系,在场景理解中扮演重要角色。尽管两阶段HOI检测器在训练与推理上具有高效优势,但由于主干网络陈旧且在交互分类器中缺乏对人类HOI感知过程的考量,其性能低于单阶段方法。本文中,我们提出基于Vision Transformer的姿态条件自环图(ViPLO)以解决这些问题。首先,我们提出一种适用于Vision Transformer主干的新颖特征提取方法,称为重叠区域掩码(MOA)模块。MOA模块在注意力函数中利用每个图像块与给定区域间的重叠区域,解决了使用Vision Transformer主干时的量化问题。此外,我们设计了一个具有姿态条件自环结构的图,用人体关节的局部特征更新人体节点编码。这使得分类器能聚焦于特定人体关节以有效识别交互类型,其受人类HOI感知过程启发。结果表明,ViPLO在两个公开基准上取得了最先进结果,尤其在HICO-DET数据集上获得了+2.07 mAP的性能提升。源代码见 https://github.com/Jeeseung-Park/ViPLO。
引用
@article{arxiv.2304.08114,
title = {ViPLO: Vision Transformer based Pose-Conditioned Self-Loop Graph for Human-Object Interaction Detection},
author = {Jeeseung Park and Jin-Woo Park and Jong-Seok Lee},
journal= {arXiv preprint arXiv:2304.08114},
year = {2023}
}
备注
CVPR 2023