无注册学习型多视角人脸密集语义对应捕获
计算机视觉与模式识别
2026-05-05 v1
摘要
近期诸如 ToFu 和 TEMPEH 的框架通过直接从标定多视角图像预测密集语义对应的 3D 网格,提供了对经典注册流程的自动化替代方案。然而,这些基于学习的方法仍依赖于它们旨在取代的缓慢、手动注册流程来获得训练监督。我们通过 MOCHI(Multi-view Optimizable Correspondence of Heads from Images,多视角可优化头部图像对应)提出了一种无需注册训练数据的多视角 3D 人脸预测框架。MOCHI 通过强制拓扑一致性来消除注册数据依赖,采用伪线性逆动力学求解器。语义对齐由来自合成数据的 2D landmarks 预测器生成的稠密关键点引导。我们的分析进一步揭示,在无注册设置下,标准的点到曲面距离会导致训练不稳定和视觉伪影。我们提出基于点图和法向的损失函数,提供更平滑的梯度和更优的重建保真度。最后,我们引入一种测试时优化方案,通过数十次迭代来细化网络权重。该方法在前向效率和迭代优化精度之间搭建了桥梁,使 MOCHI 在重建精度和视觉质量方面均优于传统耗时的管线。代码和模型已公开:https://filby89.github.io/mochi。
引用
@article{arxiv.2605.01450,
title = {Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence},
author = {Panagiotis P. Filntisis and George Retsinas and Radek Daněček and Vanessa Sklyarova and Petros Maragos and Timo Bolkart},
journal= {arXiv preprint arXiv:2605.01450},
year = {2026}
}
备注
19 pages, CVPR 2026