PaStaNet:迈向人体活动知识引擎
计算机视觉与模式识别
2020-04-22 v2 人工智能
机器学习
摘要
现有的基于图像的活动理解方法主要采用直接映射,即从图像到活动概念,由于两者间的巨大鸿沟可能遭遇性能瓶颈。有鉴于此,我们提出一条新路径:先推断人体部位状态,再基于部位级语义推理出活动。人体部位状态(PaSta)是细粒度的动作语义标记,例如 <hand, hold, something>,其可组合成活动并帮助我们迈向人体活动知识引擎。为充分利用 PaSta 的能力,我们构建了一个大规模知识库 PaStaNet,包含 700 万以上 PaSta 标注。并提出了两种相应模型:首先,我们设计了一个名为 Activity2Vec 的模型来提取 PaSta 特征,旨在作为各类活动的通用表示;其次,我们使用一种基于 PaSta 的推理方法来推断活动。在 PaStaNet 的推动下,我们的方法取得了显著提升,例如在监督学习的 HICO 全集和一次性集上 mAP 分别提高 6.4 和 13.9,在迁移学习的 V-COCO 和基于图像的 AVA 上 mAP 分别提高 3.2 和 4.2。代码与数据见 http://hake-mvig.cn/。
引用
@article{arxiv.2004.00945,
title = {PaStaNet: Toward Human Activity Knowledge Engine},
author = {Yong-Lu Li and Liang Xu and Xinpeng Liu and Xijie Huang and Yue Xu and Shiyi Wang and Hao-Shu Fang and Ze Ma and Mingyang Chen and Cewu Lu},
journal= {arXiv preprint arXiv:2004.00945},
year = {2020}
}
备注
Accepted to CVPR 2020, supplementary materials included, code available: http://hake-mvig.cn/