基于 R*CNN 的上下文动作识别
计算机视觉与模式识别
2016-03-28 v3
摘要
图像中存在多种线索可揭示人物正在执行的动作。例如,慢跑者具有慢跑特有的姿态,但场景(如道路、小径)和其他慢跑者的出现可作为附加信息来源。本工作中,我们利用“动作伴随上下文线索”这一简单观察来构建强大的动作识别系统。我们改进 RCNN 以使用多个区域进行分类,同时保持定位动作的能力。我们将该系统称为 R*CNN。动作特定模型与特征图联合训练,使得动作特定表示得以涌现。R*CNN 在 PASAL VOC Action 数据集上取得 90.2% 的平均 AP,大幅优于该领域所有其他方法。最后,我们展示 R*CNN 不仅限于动作识别。具体而言,R*CNN 也可用于解决细粒度任务,如属性分类。我们通过报告在 Berkeley Attributes of People 数据集上的最先进性能来验证这一主张。
引用
@article{arxiv.1505.01197,
title = {Contextual Action Recognition with R*CNN},
author = {Georgia Gkioxari and Ross Girshick and Jitendra Malik},
journal= {arXiv preprint arXiv:1505.01197},
year = {2016}
}