HART:面向人的重建变换器
计算机视觉与模式识别
2025-10-01 v1
摘要
我们提出 HART,这是一个用于稀疏视角人类重建的统一框架。给定一组未标定的 RGB 图像作为输入,HART 输出完整的衣物网格、对齐的 SMPL-X 身体网格,以及用于实现逼真新视角渲染的高斯溅写 representation。先前的方法要么优化参数化模板,忽略了松散服装和人体-物体交互;要么在简化的相机假设下训练隐式函数,限制了在真实场景中的适用性。相比之下,HART 预测每个像素的 3D 点图、法线和身体对应关系,并采用受遮挡感知的 Poisson 重建来恢复完整几何,即使在自遮挡区域也能准确恢复。这些预测还与参数化 SMPL-X 身体模型对齐,确保重建的几何与人体结构一致,同时捕捉松散服装和交互。这些人类对齐网格初始化高斯溅,从而进一步实现稀疏视角渲染。虽然仅在 2.3K 个合成扫描上训练,HART 仍实现了最先进的效果:衣物网格重建的 Chamfer 距离提高了 18-23 倍,SMPL-X 估计的 PA-V2V 下降了 6-27 倍,新视角合成的 LPIPS 降低了 15-27 倍。这些结果表明,前馈变换器可以作为鲁棒人类重建在真实场景中的可扩展模型。代码和模型将公开发布。
关键词
引用
@article{arxiv.2509.26621,
title = {HART: Human Aligned Reconstruction Transformer},
author = {Xiyi Chen and Shaofei Wang and Marko Mihajlovic and Taewon Kang and Sergey Prokudin and Ming Lin},
journal= {arXiv preprint arXiv:2509.26621},
year = {2025}
}
备注
Project page: https://xiyichen.github.io/hart