PEAR:像素对齐的表达人类网格恢复
计算机视觉与模式识别
2026-02-06 v2 人工智能
摘要
从单张野生图像中重建详细的 3D 人类网格仍是计算机视觉中的一个根本挑战。现有的 SMPLX 基方法往往存在推理缓慢、仅产生粗糙的身体姿态以及在面部和手部等细粒度区域出现错位或不自然制品的问题。这些问题使得当前方法难以应用于下游任务。为解决这些挑战,我们提出 PEAR—a 个快速且稳健的人类网格像素对齐恢复框架。PEAR 明确针对现有方法的三个主要局限性:推理缓慢、细粒度人类姿态细节定位不准确以及面部表情捕获不足。具体而言,为实现实时 SMPLX 参数推断,我们摒弃了依赖高分辨率输入或多分支架构的先前设计,采用干净统一的 ViT 模型能够恢复粗糙的 3D 人类几何。为弥补由于简化架构导致的细粒度细节丢失,我们引入像素级监督以优化几何,从而显著提高了细粒度人类细节的重建准确性。为使该方法实用,我们进一步提出了模块化数据标注策略丰富训练数据并增强模型鲁棒性。总体而言,PEAR 是一个无需预处理的框架,能够以 100 FPS 以上的速度同时推断 EHM-s (SMPLX 和 scaled-FLAME) 参数。在多个基准数据集上的大量实验表明,我们的方法在姿态估计准确性方面显著优于以前的 SMPLX 方法。项目页面:https://wujh2001.github.io/PEAR
引用
@article{arxiv.2601.22693,
title = {PEAR: Pixel-aligned Expressive humAn mesh Recovery},
author = {Jiahao Wu and Yunfei Liu and Lijian Lin and Ye Zhu and Lei Zhu and Jingyi Li and Yu Li},
journal= {arXiv preprint arXiv:2601.22693},
year = {2026}
}
备注
23 pages