利用图网络从双手人类演示中学习物体-动作关系
机器人学
2019-09-13 v2
摘要
识别人类动作对于人形机器人至关重要,尤其是在演示编程等领域。以往的动作识别方法主要关注正在执行的全局主导动作,但我们认为双手人体运动并非总能用一个单一动作标签充分描述。我们提出一个用于双手人类演示中逐帧动作分类与分割的系统。该系统从机器人视角采集的原始 RGB-D 视频数据中提取符号化的空间物体关系,以构建基于图的场景表示。为学习物体-动作关系,使用这些表示与真实动作标签训练一个图网络分类器,以预测每只手执行的动作。我们在一个新的 RGB-D 视频数据集上评估了所提出的分类器,该数据集展示了以双手操控动作为重点的日常动作序列。数据集包含 6 名受试者执行 9 项任务,每项重复 10 次,共计 540 段视频录像,总时长 2 小时 18 分钟,并带有每帧每只手的真实动作标签。结果表明,该分类器能够在无需事先进行时间动作分割的情况下,在逐帧预测的前 3 个结果中可靠地识别出每只手的真实执行动作(动作分类宏 F1 分数为 0.86)。
引用
@article{arxiv.1908.08391,
title = {Learning Object-Action Relations from Bimanual Human Demonstration Using Graph Networks},
author = {Christian R. G. Dreher and Mirko Wächter and Tamim Asfour},
journal= {arXiv preprint arXiv:1908.08391},
year = {2019}
}
备注
Submitted to IEEE Robotics and Automation Letters