用于人-物交互检测的位姿感知多级特征网络
计算机视觉与模式识别
2019-09-19 v1
摘要
推理人-物交互是以人为中心的场景理解中的核心问题,由于人-物配置差异大、多个共现关系实例以及关系类别间细微的视觉差异,检测此类关系对视觉系统提出了独特挑战。为应对这些挑战,我们提出一种多级关系检测策略,利用人体位姿线索捕获关系的全局空间配置,并作为一种注意力机制在人身体部位级别动态聚焦相关区域。具体地,我们设计了一个多分支深度网络,在三个语义层级上学习位姿增强的关系表示,融合交互上下文、物体特征与细粒度语义部位线索。因此,我们的方法能够生成对细粒度人-物交互的鲁棒预测,并具可解释输出。在公开基准上的大量实验评估表明,我们的模型以显著优势超越先前方法,证明了其在处理复杂场景中的有效性。
引用
@article{arxiv.1909.08453,
title = {Pose-aware Multi-level Feature Network for Human Object Interaction Detection},
author = {Bo Wan and Desen Zhou and Yongfei Liu and Rongjie Li and Xuming He},
journal= {arXiv preprint arXiv:1909.08453},
year = {2019}
}
备注
International Conference on Computer Vision 2019