中文

单次检测中所有交互对的分类

计算机视觉与模式识别 2020-01-14 v1

摘要

本文提出一种新的人体交互检测方法,基于 CALIPSO(Classifying ALl Interacting Pairs in a Single shOt,单次检测中所有交互对的分类器),一种人-物交互分类器。这一新的单次交互分类器可同时估计所有人与物体对之间的交互,而不论其数量与类别。现有最优方法采用多 shot 策略,基于一组人-物候选对的两两交互估计,其复杂度至少依赖于交互数量,至多依赖于候选对数量。相反,所提方法在整个图像上估计交互。实际上,它通过对整幅图像执行单次前向传播,同时估计所有人体主体与物体目标之间的交互。因此,其复杂度与计算时间为常数,与图像中主体、物体或交互的数量无关。具体而言,交互分类在一个密集锚框网格上完成,得益于一个联合多任务网络,其同时学习三个互补任务:(i) 交互类型预测,(ii) 目标存在性估计,以及 (iii) 通过学习度量学习策略将交互主体与目标映射到同一表示的嵌入学习。此外,我们引入以物体为中心的被动语态动词估计,显著提升了结果。在两个知名人-物交互图像数据集 V-COCO 与 HICO-DET 上的评估表明,所提方法(第 2 名)相较最优方法具有竞争力,同时计算时间恒定,与图像中物体及交互数量无关。

关键词

引用

@article{arxiv.2001.04360,
  title  = {Classifying All Interacting Pairs in a Single Shot},
  author = {Sanaa Chafik and Astrid Orcesi and Romaric Audigier and Bertrand Luvison},
  journal= {arXiv preprint arXiv:2001.04360},
  year   = {2020}
}

备注

WACV 2020 (to appear)