TeMO:面向多物体网格的文本驱动3D风格化
计算机视觉与模式识别
2023-12-08 v1
摘要
最近,基于CLIP的方法极大地推动了文本驱动的单个物体3D风格化的发展。然而,多物体3D场景的风格化仍然受到阻碍,因为用于预训练CLIP的图像-文本对大多只包含一个物体。同时,由于现有的监督方式主要依赖于图像-文本对的粗粒度对比,多个物体的局部细节可能容易被忽略。为了克服这些挑战,我们提出了一个新颖的框架,称为TeMO,用于解析多物体3D场景并在多级对比监督下编辑其风格。我们首先提出一个解耦图注意力(DGA)模块,以区分性地增强3D表面点的特征。特别地,构建了一个跨模态图来准确对齐物体点和从3D网格及文本描述中解耦出的名词短语。然后,我们开发了一个跨粒度对比(CGC)监督系统,其中在文本描述中的单词和随机渲染的图像之间构建细粒度损失以补充粗粒度损失。大量实验表明,我们的方法可以合成高质量的风格化内容,并在广泛的多物体3D网格上优于现有方法。我们的代码和结果将公开提供。
引用
@article{arxiv.2312.04248,
title = {TeMO: Towards Text-Driven 3D Stylization for Multi-Object Meshes},
author = {Xuying Zhang and Bo-Wen Yin and Yuming Chen and Zheng Lin and Yunheng Li and Qibin Hou and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2312.04248},
year = {2023}
}