检测与识别人-物交互
计算机视觉与模式识别
2018-03-28 v3
摘要
为理解视觉世界,机器不仅必须识别个体对象实例,还需识别它们如何交互。人类常处于此类交互中心,检测人-物交互是一个重要实用与科学问题。本文中,我们解决在挑战性日常照片中检测<human, verb, object>三元组的任务。我们提出一种由以人为中心的方法驱动的新模型。我们的假设是,一个人的外观——姿态、衣着、动作——是定位其交互对象的强大线索。为利用此线索,我们的模型基于检测到的人物外观学习预测关于目标对象位置的特定动作密度。我们的模型还联合学习检测人与对象,并通过融合这些预测,在称为InteractNet的干净、联合训练的端到端系统中高效推断交互三元组。我们在最近引入的Verbs in COCO (V-COCO)和HICO-DET数据集上验证我们的方法,展示了数量上令人信服的结果。
引用
@article{arxiv.1704.07333,
title = {Detecting and Recognizing Human-Object Interactions},
author = {Georgia Gkioxari and Ross Girshick and Piotr Dollár and Kaiming He},
journal= {arXiv preprint arXiv:1704.07333},
year = {2018}
}