中文

Anny-Fit:全年龄段人体网格恢复

计算机视觉与模式识别 2026-05-07 v1

摘要

从单张图像中恢复 3D 人体姿态与形状是以人为中心的视觉领域的基石,然而大多数方法假设对象为成年人且独立优化每个人。这些假设在现实世界的全年龄段场景中会失效,因为身体比例和深度必须被联合求解。我们提出 Anny-Fit,一个用于全年龄段 3D 人体网格恢复(HMR)的多人相机空间优化框架。与现有的逐人拟合方法不同,Anny-Fit 直接在相机坐标系中联合优化所有个体,强制实现全局空间一致性。我们方法的核心是使用多种形式的专家知识——包括度量深度图、实例分割、2D 关键点,以及由 VLM 衍生的语义属性(如年龄和性别)——每一项均从专门的现成网络中获取。这些互补的信号共同引导优化过程,约束了全年龄段场景中特有的深度-尺度模糊性。在多个多样化数据集上,Anny-Fit 持续提升了 2D 重投影精度(+13 至 16)、相对深度排序(+6 至 7)、3D 估计误差(-9 至 -29)以及形状估计(+25 至 +82),生成了更加连贯的场景。最后,我们表明,基于 VLM 的语义知识可以通过 Anny-Fit 在训练数据上生成的伪真值标注蒸馏到 HMR 模型中,使其能够学习具有语义意义的形状参数,同时提升 HMR 性能。我们的方法通过实现对成年数据训练的 HMR 流程在全年龄段谱系上的零样本适应而无需重训练,弥合了仅针对成年人与全年龄段建模之间的鸿沟。代码已公开于 https://github.com/naver/anny-fit。

关键词

引用

@article{arxiv.2605.04728,
  title  = {Anny-Fit: All-Age Human Mesh Recovery},
  author = {Laura Bravo-Sánchez and Matthieu Armando and Romain Brégier and Grégory Rogez and Serena Yeung-Levy and Fabien Baradel},
  journal= {arXiv preprint arXiv:2605.04728},
  year   = {2026}
}

备注

CVPR 2026 Findings Track - Code available at https://github.com/naver/anny-fit