GraphMLP:一种用于三维人体姿态估计的类图 MLP 架构
计算机视觉与模式识别
2024-09-24 v5 人工智能
机器学习
摘要
现代多层感知机(MLP)模型已在学习视觉表征方面展现出无需自注意力的竞争性结果。然而,现有 MLP 模型不擅长捕捉局部细节,且缺乏人体构型的先验知识,这限制了其对骨骼表征学习的建模能力。为解决这些问题,我们提出一种简单而有效的图增强类 MLP 架构,名为 GraphMLP,它将 MLP 与图卷积网络(GCNs)结合于全局-局部-图统一的架构中,用于三维人体姿态估计。GraphMLP 将人体图结构融入 MLP 模型,以满足三维人体姿态的特定领域需求,同时允许局部与全局空间交互。此外,我们提出灵活且高效地将 GraphMLP 扩展至视频域,并表明复杂的时序动态可以简单方式有效建模,且序列长度带来的计算成本增益可忽略。据我们所知,这是首个用于单帧与视频序列中三维人体姿态估计的类 MLP 架构。大量实验表明,所提 GraphMLP 在两个数据集(即 Human3.6M 与 MPI-INF-3DHP)上达到了最先进性能。代码与模型见 https://github.com/Vegetebird/GraphMLP。
引用
@article{arxiv.2206.06420,
title = {GraphMLP: A Graph MLP-Like Architecture for 3D Human Pose Estimation},
author = {Wenhao Li and Mengyuan Liu and Hong Liu and Tianyu Guo and Ti Wang and Hao Tang and Nicu Sebe},
journal= {arXiv preprint arXiv:2206.06420},
year = {2024}
}
备注
Accepted by Pattern Recognition, Open Sourced