RUMPL:基于射线的 Transformer 用于通用多视角 2D 到 3D 人体姿态提升
计算机视觉与模式识别
2025-12-18 v1
摘要
从 2D 图像估计 3D 人体姿态仍然具有挑战性,原因在于遮挡和投影歧义。基于多视角的学习方法缓解了这些问题,但通常无法泛化到真实场景,因为具有 3D 真值的大规模多视角数据集稀缺且在受限条件下采集。为克服这一限制,近期方法依赖于 2D 姿态估计结合在合成数据上训练的 2D 到 3D 姿态提升。在我们之前的 MPL 框架基础上,我们提出 RUMPL,一个基于 Transformer 的 3D 姿态提升器,引入了 2D 关键点的 3D 射线表示。该公式使模型独立于相机标定和视角数量,无需重新训练或微调即可在任意多视角配置下通用部署。新的 View Fusion Transformer 利用学习到的融合射线 token 沿射线聚合信息,进一步提升多视角一致性。大量实验表明,RUMPL 相比三角化将 MPJPE 降低最多 53%,相比基于 Transformer 的图像表示基线降低超过 60%。在新基准上的结果,包括野外多视角和多人数据集,确认了其鲁棒性和可扩展性。该框架的源代码可在 https://github.com/aghasemzadeh/OpenRUMPL 获取。
引用
@article{arxiv.2512.15488,
title = {RUMPL: Ray-Based Transformers for Universal Multi-View 2D to 3D Human Pose Lifting},
author = {Seyed Abolfazl Ghasemzadeh and Alexandre Alahi and Christophe De Vleeschouwer},
journal= {arXiv preprint arXiv:2512.15488},
year = {2025}
}