PoseMoE:用于单目三维人体姿态估计的专家混合网络
计算机视觉与模式识别
2025-12-19 v1 人工智能
摘要
基于提升的方法通过利用检测到的二维姿态作为中间表示,在单目三维人体姿态估计中占据主导地位。最终三维人体姿态的二维分量受益于检测到的二维姿态,而其深度 counterpart 则必须从头估计。基于提升的方法在纠缠的特征空间中编码检测到的二维姿态和未知深度,明确地将深度不确定性引入检测到的二维姿态,从而限制了整体估计精度。本工作揭示了深度表示对于估计过程的关键作用。具体而言,当深度处于初始的完全未知状态时,联合编码深度特征与二维姿态特征对估计过程是有害的。相反,当深度通过网络估计首先被细化到更可靠的状态时,将其与二维姿态信息联合编码是有益的。为解决这一局限性,我们提出了一种用于单目三维姿态估计的专家混合网络PoseMoE。我们的方法引入:(1) 一个专家混合网络,其中专门的专家模块细化检测良好的二维姿态特征并学习深度特征。这种专家混合设计将二维姿态和深度的特征编码过程解耦,从而减少了不确定的深度特征对二维姿态特征的显式影响。(2) 提出了一种跨专家知识聚合模块,用于聚合跨专家的时空上下文信息。该步骤通过二维姿态与深度之间的双向映射增强特征。大量实验表明,所提出的PoseMoE在三个广泛使用的数据集上优于传统的基于提升的方法:Human3.6M、MPI-INF-3DHP和3DPW。
引用
@article{arxiv.2512.16494,
title = {PoseMoE: Mixture-of-Experts Network for Monocular 3D Human Pose Estimation},
author = {Mengyuan Liu and Jiajie Liu and Jinyan Zhang and Wenhao Li and Junsong Yuan},
journal= {arXiv preprint arXiv:2512.16494},
year = {2025}
}
备注
IEEE Transactions on Image Processing (T-IP)