EgoPoseFormer:用于立体式自我姿态估计的简单基线
计算机视觉与模式识别
2024-08-16 v2
摘要
我们提出 EgoPoseFormer,一个简单而有效的基于 Transformer 的立体式自我姿态估计模型。在自我姿态估计中,主要挑战是克服关节不可见性,这种不可见性由自遮挡或头部摄像机的受限视野 (FOV) 引起。我们的方法通过两个阶段的姿态估计范式来克服这一挑战:在第一个阶段,我们的模型利用全局信息来估计每个关节的粗略位置;在第二个阶段,我们采用 DETR 风格的 Transformer 来利用细粒度的立体视觉特征对粗略位置进行精细化。在此基础上,我们提出了可变形立体注意力操作,使我们的 Transformer 能够有效地处理多视角特征,从而在 3D 世界中准确定位每个关节。我们在立体 UnrealEgo 数据集上评估了该方法,表明它在保持计算效率的同时显著优于以往方法:仅使用 7.9% 的模型参数和 13.1% 的 FLOPs,就将 MPJPE 提高了 27.4mm(45% 的改进)。意外地,我们发现即使在正确的训练设置下,我们的第一个阶段姿态提议网络也能比以往方法表现更好。我们还显示,该方法可以无缝扩展到单目设置,在 SceneEgo 数据集上实现了最先进的性能,MPJPE 比最佳现有方法提高了 25.5mm(21% 的改进),仅使用 60.7% 的模型参数和 36.4% 的 FLOPs。代码已公开:https://github.com/ChenhongyiYang/egoposeformer 。
关键词
引用
@article{arxiv.2403.18080,
title = {EgoPoseFormer: A Simple Baseline for Stereo Egocentric 3D Human Pose Estimation},
author = {Chenhongyi Yang and Anastasia Tkach and Shreyas Hampali and Linguang Zhang and Elliot J. Crowley and Cem Keskin},
journal= {arXiv preprint arXiv:2403.18080},
year = {2024}
}
备注
Accepted to ECCV 2024