扫视与凝视:用于单阶段人-物交互检测的动作感知点推断
计算机视觉与模式识别
2021-04-13 v1
摘要
现代的人-物交互(HOI)检测方法可分为单阶段方法和两阶段方法。单阶段模型因其简洁的架构而更高效,但两阶段模型在精度上仍具优势。现有的单阶段模型通常先检测预定义的交互区域或点,然后仅关注这些区域进行交互预测;因此,它们缺乏动态搜索判别性线索的推理步骤。本文中,我们提出一种新颖的单阶段方法,即扫视与凝视网络(GGNet),它通过扫视和凝视步骤自适应地建模一组动作感知点(ActPoints)。扫视步骤快速确定特征图中每个像素是否为交互点。凝视步骤利用扫视步骤产生的特征图,以渐进方式在每个像素周围自适应推断 ActPoints。精炼后 ActPoints 的特征被聚合用于交互预测。此外,我们设计了一种动作感知方法,有效地将每个检测到的交互与其关联的人-物对匹配,并提出了一种新颖的难负样本注意力损失以改进 GGNet 的优化。上述所有操作均在特征图中对所有像素同时高效进行。最终,GGNet 在 V-COCO 和 HICO-DET 基准上以显著优势优于最先进的方法。GGNet 的代码可在 https://github.com/SherlockHolmes221/GGNet 获取。
引用
@article{arxiv.2104.05269,
title = {Glance and Gaze: Inferring Action-aware Points for One-Stage Human-Object Interaction Detection},
author = {Xubin Zhong and Xian Qu and Changxing Ding and Dacheng Tao},
journal= {arXiv preprint arXiv:2104.05269},
year = {2021}
}
备注
Accepted to CVPR2021