中文

StyleSculptor:基于纹理-几何双导向的零样体控 3D 资产生成

计算机视觉与模式识别 2025-09-18 v2

摘要

创建遵循现有纹理和几何风格的 3D 资产在实际应用中(如视频游戏和虚拟现实)往往是理想的甚至不可避免的。在从文本或图像生成 3D 对象的方面取得了令人印象深刻的进展,但创建可控的风格 3D 资产仍是一个复杂且具挑战性的问题。本文提出了 StyleSculptor,一种新的无训练方法,用于从内容图像和一个或多个风格图像生成风格导向的 3D 资产。不同于以往工作,StyleSculptor 以零样本方式实现风格导向的 3D 生成,使能够捕获用户提供风格图像中纹理、几何或两者兼有的细粒度 3D 风格控制。StyleSculptor 的核心是一个新的 Style Disentangled Attention(SD-Attn)模块,通过跨 3D 注意力机制在输入内容图像和风格图像之间建立动态交互,以实现风格导向的 3D 资产生成,使特征融合稳定且有效地引导风格生成。为缓解语义内容泄漏,我们还在 SD-Attn 模块中引入了风格-内容特征选择策略,该策略利用 3D 特征块的方差来解耦风格和内容显著通道,使注意力框架内的选择性特征注入成为可能。有了 SD-Attn,网络可以动态计算纹理导向、几何导向或两者导向的特征,以引导 3D 生成过程。在此基础上,我们进一步提出了风格导向控制(SGC)机制,使能够独立进行几何或纹理的风格化,以及可调整的风格强度控制。广泛的实验表明,StyleSculptor 在生成高保真 3D 资产方面优于现有的基线方法。

关键词

引用

@article{arxiv.2509.13301,
  title  = {StyleSculptor: Zero-Shot Style-Controllable 3D Asset Generation with Texture-Geometry Dual Guidance},
  author = {Zefan Qu and Zhenwei Wang and Haoyuan Wang and Ke Xu and Gerhard Hancke and Rynson W. H. Lau},
  journal= {arXiv preprint arXiv:2509.13301},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025, Project page:https://stylesculptor.github.io