RomanTex:面向纹理合成的解耦3D感知旋转位置嵌入多头注意力网络
计算机视觉与模式识别
2025-03-26 v1
摘要
为已有几何体绘制纹理是3D资产生成中一项关键但劳动密集的过程。文本到图像(T2I)模型的最新进展显著推动了纹理生成的发展。现有研究大多通过图像扩散模型在二维空间中先生成图像,再经纹理烘焙得到UV纹理。然而,由于生成的多视图图像之间存在不一致性,这些方法常常难以产出高质量纹理,导致接缝与重影瑕疵。相比之下,基于3D的纹理合成方法旨在解决这些不一致性,但往往忽视了二维扩散模型的先验,使其难以应用于真实物体。为克服上述局限,我们提出RomanTex——一种基于多视图的纹理生成框架。该框架将多头注意力网络与底层3D表示相融合,并借助我们新提出的3D感知旋转位置嵌入加以实现。此外,我们在多头注意力模块中引入解耦特性,以增强模型在图像到纹理任务中的鲁棒性,从而实现语义正确的背面合成。进一步,我们提出一种与几何相关的无分类器引导(CFG)机制,以进一步提升与几何及图像的对齐程度。定量与定性评估,以及全面的用户研究表明,我们的方法在纹理质量与一致性方面达到了当前最优(state-of-the-art)结果。
引用
@article{arxiv.2503.19011,
title = {RomanTex: Decoupling 3D-aware Rotary Positional Embedded Multi-Attention Network for Texture Synthesis},
author = {Yifei Feng and Mingxin Yang and Shuhui Yang and Sheng Zhang and Jiaao Yu and Zibo Zhao and Yuhong Liu and Jie Jiang and Chunchao Guo},
journal= {arXiv preprint arXiv:2503.19011},
year = {2025}
}
备注
11 pages, 5 figures