DiffProxy: 通过扩散生成的稠密代理实现多视角人体网格恢复
计算机视觉与模式识别
2026-03-16 v2
摘要
从多视角图像中精确恢复人体网格(HMR)仍然具有挑战性:端到端方法产生难以定位的纠缠误差,而基于拟合的方法依赖提供有限表面约束的稀疏关键点。我们观察到真正的瓶颈在于中间表示的质量,而密集像素到表面的对应关系可以通过重新利用具有丰富视觉先验的预训练扩散模型来有效生成。我们提出 DiffProxy,一个基于 Stable Diffusion 的框架,在具有像素级精确标注的大规模合成数据上进行训练。多条件代理生成器从多视角图像预测密集对应关系,提供统一的表面约束以实现精确拟合。手部细化将放大后的手部裁剪区域与全身图像一起输入以获取细粒度细节,而测试时缩放利用扩散随机性来估计逐像素不确定性。仅在合成数据上训练,DiffProxy 在五个多样化的真实世界基准上取得了最先进的结果。
引用
@article{arxiv.2601.02267,
title = {DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies},
author = {Renke Wang and Zhenyu Zhang and Ying Tai and Jun Li and Jian Yang},
journal= {arXiv preprint arXiv:2601.02267},
year = {2026}
}
备注
Page: https://wrk226.github.io/DiffProxy.html, Code: https://github.com/wrk226/DiffProxy