中文

用于操作动作识别与预测的一种变分图自编码器

计算机视觉与模式识别 2021-10-27 v1 机器人学

摘要

尽管经过数十年的研究,理解人类操作活动始终是计算机视觉与机器人领域最具吸引力且最具挑战性的研究课题之一。对已观测人类操作动作的识别与预测根植于诸如人机交互和机器人示教学习等相关应用。当前研究趋势严重依赖先进卷积神经网络来处理结构化欧氏数据,例如RGB相机图像。然而,这些网络伴随着巨大的计算复杂度,以处理高维原始数据。与相关工作不同,我们在此引入一种深度图自编码器,从符号化场景图联合学习操作任务的识别与预测,而非依赖结构化欧氏数据。我们的网络具有变分自编码器结构,包含两支:一支用于识别输入图类型,一支用于预测未来图。所提网络的输入是一组语义图,存储场景中主体与客体之间的空间关系。网络输出是代表所检测与预测类别类型的标签集。我们在MANIAC和MSRC-9两个不同数据集上将新模型与多种最先进方法基准对比,表明所提模型可取得更优性能。我们也发布了源代码 https://github.com/gamzeakyol/GNet。

关键词

引用

@article{arxiv.2110.13280,
  title  = {A Variational Graph Autoencoder for Manipulation Action Recognition and Prediction},
  author = {Gamze Akyol and Sanem Sariel and Eren Erdal Aksoy},
  journal= {arXiv preprint arXiv:2110.13280},
  year   = {2021}
}

备注

Accepted for publication in the Proceedings of 2021 20th International Conference on Advanced Robotics (ICAR)