LHM++: 用于从姿态自由图像重建大规模人类的高效模型
计算机视觉与模式识别
2026-03-17 v2
摘要
从无需相机或姿态信息的交互式主体图像中重建可动画的 3D 人类一直是高度实用的,但由于视角错位、遮挡以及结构性先验条件的缺失,仍具有挑战性。本文提出 LHM++,一个高效的大规模人类重建模型,可在数秒内从一个或多个姿态自由图像中生成高质量、可动画的 3D 头像。其核心是一种逐步编码和解码 3D 几何点特征的编码-解码点-图像 Transformer 架构,以提高效率,同时通过多模态注意力融合层次 3D 点特征与图像特征。融合后的特征被解码为 3D 高斯 splat,以恢复细致的几何和外观。为进一步提升视觉保真度,我们引入了轻量级 3D-aware 神经动画渲染器,以实时优化重建头像的渲染质量。广泛的实验表明,我们的方法在不要求相机或姿态标注的情况下,能够产生高保真度、可动画的 3D 人类。我们的代码和项目页面均可在 https://lingtengqiu.github.io/LHM++ 访问。
引用
@article{arxiv.2506.13766,
title = {LHM++: An Efficient Large Human Reconstruction Model for Pose-free Images to 3D},
author = {Lingteng Qiu and Peihao Li and Heyuan Li and Qi Zuo and Xiaodong Gu and Yuan Dong and Weihao Yuan and Rui Peng and Siyu Zhu and Xiaoguang Han and Guanying Chen and Zilong Dong},
journal= {arXiv preprint arXiv:2506.13766},
year = {2026}
}
备注
HomePage: https://lingtengqiu.github.io/LHM++/ Online Demo: https://huggingface.co/spaces/Lingteng/LHMPP