3DLatNav:导航生成式潜空间以实现语义感知的 3D 物体操控
计算机视觉与模式识别
2022-11-18 v1
摘要
3D 生成模型近来在以点云形式生成逼真 3D 物体方面取得了成功。然而,大多数模型无法在缺乏大量语义属性标签或其他参考点云的情况下,对部件级物体形状的语义进行可控操控。此外,除了简单的潜向量算术或插值能力之外,人们对于 3D 形状的部位级语义如何编码于其相应生成式潜空间中仍缺乏理解。本文提出 3DLatNav;一种导航预训练生成式潜空间以实现 3D 物体可控部件级语义操控的新方法。首先,我们提出一种利用 3D 形状潜表示的部件级弱监督形状语义识别机制。然后,我们将该知识迁移到预训练 3D 物体生成式潜空间,以解析出解耦嵌入,将物体组成部件的不同形状语义表示为线性子空间的形式,尽管训练期间缺乏部件级标签。最后,我们利用这些已识别的子空间表明,通过将所提框架应用于任何预训练 3D 生成模型,可实现可控的 3D 物体部件操控。借助两个评估部件级操控一致性与定位精度的新型定量指标,我们表明 3DLatNav 在识别编码 3D 物体部件级形状语义的潜方向方面优于现有的无监督潜解耦方法。通过多项消融研究及在最先进生成模型上的测试,我们表明 3DLatNav 能在保留其他特征与物体逼真性的同时对输入点云实施可控的部件级语义操控。
引用
@article{arxiv.2211.09770,
title = {3DLatNav: Navigating Generative Latent Spaces for Semantic-Aware 3D Object Manipulation},
author = {Amaya Dharmasiri and Dinithi Dissanayake and Mohamed Afham and Isuru Dissanayake and Ranga Rodrigo and Kanchana Thilakarathna},
journal= {arXiv preprint arXiv:2211.09770},
year = {2022}
}