中文

描述图像中常见的人类视觉动作

计算机视觉与模式识别 2015-06-09 v1

摘要

在单目静态图像中可识别哪些常见人类动作与交互?哪些涉及物体和/或其他人?一个人一次执行多少个动作?我们通过探索 MS COCO 数据集图像中可检测的动作与交互来回答这些问题。我们做出了两点主要贡献。第一,一份包含 140 个常见“视觉动作”的列表,该列表通过分析当前最大的英文在线动词词典(VerbNet)以及 MS COCO 中用于描述图像的人类语句得到。第二,针对这些“视觉动作”的一套完整标注,由主语-宾语及关联动词组成,我们称之为 COCO-a(a 代表“actions”)。COCO-a 在动作数量及这些动作的实例数量上均大于现有动作数据集,并且其独特之处在于它是数据驱动的,而非实验者偏置的。其他独特特征包括它是穷尽的,且所有主语与宾语均被定位。我们提供了关于标注准确性以及每个动作、交互和主宾组合的统计性分析。

关键词

引用

@article{arxiv.1506.02203,
  title  = {Describing Common Human Visual Actions in Images},
  author = {Matteo Ruggero Ronchi and Pietro Perona},
  journal= {arXiv preprint arXiv:1506.02203},
  year   = {2015}
}