基于多视图扩散先验的无监督单目三维关键点发现
计算机视觉与模式识别
2025-07-17 v1
摘要
本文提出 KeyDiff3D 框架,用于从单张图像进行无监督的三维关键点估计,能够准确预测来自单张图像的三维关键点。虽然先前方法依赖手动标注或校准的多视图图像,而这两种方法都需要大量数据收集工作,但我们的方法仅需单视图图像集合即可实现单目三维关键点估计。为实现这一目标,我们利用预训练多视图扩散模型中嵌入的强大几何先验。在我们的框架中,该模型从单张图像生成多视图图像,作为监督信号为我们的模型提供三维几何线索。我们还将扩散模型用作强大的 2D 多视图特征提取器,并从其中间表示构建三维特征体积。这将模型学习到的隐式三维先验转化为显式的三维特征。除了精确的关键点估计,我们进一步引入一个管线,使能够操作由扩散模型生成的三维对象。在 diverse aspects 和多个数据集上进行实验,包括 Human3.6M、Stanford Dogs 以及多个野外和超出域的数据集,结果显示我们方法在准确性、泛化性方面均表现突出,并能够实现对来自单张图像由扩散模型生成的三维对象的操作。
引用
@article{arxiv.2507.12336,
title = {Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors},
author = {Subin Jeon and In Cho and Junyoung Hong and Seon Joo Kim},
journal= {arXiv preprint arXiv:2507.12336},
year = {2025}
}