LHM:单张图像秒级生成大型可动画人体重建模型
计算机视觉与模式识别
2025-03-14 v1 人工智能
摘要
从单张图像进行可动画三维人体重建是一项具有挑战性的任务,原因在于几何、外观和变形的解耦存在歧义。近期的三维人体重建研究主要聚焦于静态人体建模,且依赖合成三维扫描进行训练,这限制了其泛化能力。相反,基于优化的视频方法虽然实现了更高的保真度,但需要受控的采集条件和计算密集型的细化过程。受大型重建模型用于高效静态重建的启发,我们提出 LHM(Large Animatable Human Reconstruction Model),通过前馈推理推断以三维高斯溅射表示的高保真 avatar。我们的模型利用多模态 Transformer 架构,结合注意力机制有效编码人体位置特征和图像特征,实现对服装几何与纹理的精细保留。为进一步提升面部身份保持和细粒度细节恢复,我们提出头部特征金字塔编码方案,用于聚合头部区域的多尺度特征。大量实验表明,LHM 可在数秒内生成合理的可动画人体,无需后处理即可恢复面部和手部,在重建精度和泛化能力上均优于现有方法。
引用
@article{arxiv.2503.10625,
title = {LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds},
author = {Lingteng Qiu and Xiaodong Gu and Peihao Li and Qi Zuo and Weichao Shen and Junfei Zhang and Kejie Qiu and Weihao Yuan and Guanying Chen and Zilong Dong and Liefeng Bo},
journal= {arXiv preprint arXiv:2503.10625},
year = {2025}
}
备注
Project Page: https://lingtengqiu.github.io/LHM/