长而复杂的操作动作序列的语义分解与识别
计算机视觉与模式识别
2019-09-27 v1
摘要
理解连续的人类动作是计算机视觉中一个非平凡但重要的问题。尽管在动作序列识别方面已有大量工作,但大多数方法在应对运动、动作组合和场景背景的巨大变化时存在问题。在本文中,我们引入了一种用于长而复杂的操作动作任务(如“准备早餐”或“制作三明治”)的语义分割与识别的新方法。我们用最近引入的“语义事件链”概念来表示操作动作,该概念捕获了动作不随运动、速度和场景背景变化的底层时空结构。仅基于提取的 SEC 中被操作物体与手之间的时空交互,该框架自动解析顺序或并发执行的各个操作流。利用事件链,我们的方法进一步提取每个解析操作的基本原语元素。无需任何先验物体知识,所提出的框架还能提取在语义相似的操作中表现出相同作用的类物体场景实体。我们在多个最新数据集上进行了广泛实验,以验证该框架的鲁棒性。
引用
@article{arxiv.1610.05693,
title = {Semantic Decomposition and Recognition of Long and Complex Manipulation Action Sequences},
author = {Eren Erdal Aksoy and Adil Orhan and Florentin Woergoetter},
journal= {arXiv preprint arXiv:1610.05693},
year = {2019}
}
备注
IJCV preprint manuscript