中文

扫视与凝视:用于单阶段人-物交互检测的动作感知点推断

计算机视觉与模式识别 2021-04-13 v1

摘要

现代的人-物交互(HOI)检测方法可分为单阶段方法和两阶段方法。单阶段模型因其简洁的架构而更高效,但两阶段模型在精度上仍具优势。现有的单阶段模型通常先检测预定义的交互区域或点,然后仅关注这些区域进行交互预测;因此,它们缺乏动态搜索判别性线索的推理步骤。本文中,我们提出一种新颖的单阶段方法,即扫视与凝视网络(GGNet),它通过扫视和凝视步骤自适应地建模一组动作感知点(ActPoints)。扫视步骤快速确定特征图中每个像素是否为交互点。凝视步骤利用扫视步骤产生的特征图,以渐进方式在每个像素周围自适应推断 ActPoints。精炼后 ActPoints 的特征被聚合用于交互预测。此外,我们设计了一种动作感知方法,有效地将每个检测到的交互与其关联的人-物对匹配,并提出了一种新颖的难负样本注意力损失以改进 GGNet 的优化。上述所有操作均在特征图中对所有像素同时高效进行。最终,GGNet 在 V-COCO 和 HICO-DET 基准上以显著优势优于最先进的方法。GGNet 的代码可在 https://github.com/SherlockHolmes221/GGNet 获取。

关键词

引用

@article{arxiv.2104.05269,
  title  = {Glance and Gaze: Inferring Action-aware Points for One-Stage Human-Object Interaction Detection},
  author = {Xubin Zhong and Xian Qu and Changxing Ding and Dacheng Tao},
  journal= {arXiv preprint arXiv:2104.05269},
  year   = {2021}
}

备注

Accepted to CVPR2021