OmniFit:基于规模无关稠密地标预测的多模态3D人体拟合
计算机视觉与模式识别
2026-04-24 v1 图形学
摘要
拟合底层人体模型到3D衣物人类资产已广泛研究,但大多数方法仅聚焦于单一模态输入(如点云或多视角图像),且常需已知的度量尺度。这一约束在AI生成资产中尤为不实,因其常常伴随尺度失真。我们提出了OmniFit,该方法能无缝处理多样化的多模态输入,包括完整扫描、部分深度观测和图像捕获,同时对实际和合成资产保持尺度无关。我们的关键创新是一种简单而有效的条件转换器解码器,直接将表面点映射到稠密人体地标,用于SMPL-X参数拟合。此外,一个可选的即插即用图像适配器整合视觉线索,以补偿缺失的几何信息。我们进一步引入一个专门的尺度预测器,将主体重新缩放至标准人体比例。OmniFit在日常服装和松散服装场景中显著优于最先进方法,提升幅度达57.1%至80.9%。据我们所知,它是首个超越多视角优化基准的人体拟合方法,也是首个在CAPE和4D-DRESS基准上实现毫米级精度的方法。
引用
@article{arxiv.2604.21575,
title = {OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction},
author = {Zeyu Cai and Yuliang Xiu and Renke Wang and Zhijing Shao and Xiaoben Li and Siyuan Yu and Chao Xu and Yang Liu and Baigui Sun and Jian Yang and Zhenyu Zhang},
journal= {arXiv preprint arXiv:2604.21575},
year = {2026}
}
备注
Project Page: https://zcai0612.github.io/OmniFit/