Sapiens2
计算机视觉与模式识别
2026-04-24 v1
摘要
我们提出Sapiens2,这是一套面向人类中心视觉任务的高分辨率变换模型家族,强调泛化性、通用性和高保真输出。模型规模从0.4亿到50亿参数不等,支持原生1K分辨率及层次化变体,可实现4K。相较前代模型,Sapiens2在预训练和后训练方面均取得显著提升。首先,为学习既能捕获低级细节(密集预测)又能捕获高级语义(零样本或少标签场景)的特征,我们将掩码图像重建与自蒸馏对比目标统一。我们的评估表明,这一统一预训练目标更适合支持更广泛的下游任务。其次,在数据层面,我们在10亿张高质量人类图像上进行预训练,并提升了任务标注的质量和数量。再者,在架构层面,我们引入前沿模型的多项进展,实现更长的训练周期并提升训练稳定性。4K模型采用窗口注意力机制,以获取更长的空间上下文,并采用2K输出分辨率进行预训练。Sapiens2在姿态估计(+4 mAP)、身体部位分割(+24.3 mIoU)、法线估计(45.6%更低的角度误差)等任务上均创下新纪录,并扩展到点图和反射率估计等新任务。代码:https://github.com/facebookresearch/sapiens2
引用
@article{arxiv.2604.21681,
title = {Sapiens2},
author = {Rawal Khirodkar and He Wen and Julieta Martinez and Yuan Dong and Su Zhaoen and Shunsuke Saito},
journal= {arXiv preprint arXiv:2604.21681},
year = {2026}
}
备注
Accepted to ICLR 2026