中文

基于方差对齐的 3D-2D 协同去噪用于文本引导纹理贴图

计算机视觉与模式识别 2024-08-16 v2

摘要

最近的研究在 3D 形状纹理合成方面受益于 2D 文本到图像扩散模型的快速发展,包括基于填充和基于优化的方法。然而,这些方法忽略了 2D 扩散模型与 3D 对象的模态差距,主要将 3D 对象渲染为 2D 图像并单独为每个图像进行纹理化。在本文中,我们重新审视纹理合成,提出一种基于方差对齐的 3D-2D 协同去噪框架,称为 VCD-Texture,以解决上述问题。形式上,我们首先在扩散自注意力模块中统一 2D 和 3D 潜特征学习,采用重新投影的 3D 注意力感受野。随后,将去噪后的多视角 2D 潜特征聚合到 3D 空间中,然后光栅化以形成更一致的 2D 预测。然而,光栅化过程受到难以解决的方差偏差的制约,通过提出的方差对齐理论予以解决,实现高保真纹理合成。此外,我们提出一种填充细化以进一步提高具有冲突区域的细节。值得注意的是,目前没有公开的基准用于评估纹理合成,这会阻碍其发展。因此,我们构建了一个基于三个开源 3D 数据集的新评估集,并提出使用四个指标来全面验证纹理合成性能。综合实验表明,VCD-Texture 在其他方法上表现显著优越。

关键词

引用

@article{arxiv.2407.04461,
  title  = {VCD-Texture: Variance Alignment based 3D-2D Co-Denoising for Text-Guided Texturing},
  author = {Shang Liu and Chaohui Yu and Chenjie Cao and Wen Qian and Fan Wang},
  journal= {arXiv preprint arXiv:2407.04461},
  year   = {2024}
}

备注

ECCV 2024