AugLift:深度感知输入重参数化提升2D到3D姿态估计的领域泛化
计算机视觉与模式识别
2026-04-09 v4 机器学习
摘要
基于提升的3D人体姿态估计从2D关键点推断3D关节,但由于坐标本身是不明确且稀疏的表征,忽略了现代基础模型可恢复的几何信息,导致其在领域泛化方面表现不佳。我们提出了\emph{AugLift},通过两个模块改变提升从2D坐标到6D几何描述符的表征格式:(1)一个\emph{不确定性感知深度描述符}(UADD)——从基于置信度缩放的邻域中提取的紧凑型组合并从离线的单目深度图中提取——以及(2)一个尺度归一化组件,用于处理训练/测试距离偏移。AugLift无需新传感器、无需新数据收集,仅需在输入层加宽即可;由于其在表征层面运行,它可以与任何提升架构或领域泛化技术兼容。在检测设置下,AugLift在四个数据集和四个提升架构上平均降低跨数据集MPJPE %,同时在内在分布准确性提升 %;事后分析显示,收益集中在 novel poses 和被遮挡关节上。在 ground-truth 2D 设置下,将AugLift与PoseAug的可微分领域泛化结合,可实现状态最佳的跨数据集性能(3DHP为62.4mm,3DPW为92.6mm;分别高出PoseAug的 %和 %),表明 foundation-model 深度提供了与显式3D增强互补的真实几何信号。代码将公开发布。
引用
@article{arxiv.2508.07112,
title = {AugLift: Depth-Aware Input Reparameterization Improves Domain Generalization in 2D-to-3D Pose Lifting},
author = {Nikolai Warner and Wenjin Zhang and Hamid Badiozamani and Irfan Essa and Apaar Sadhwani},
journal= {arXiv preprint arXiv:2508.07112},
year = {2026}
}
备注
Preprint. Under review