中文

面向文本引导3D扩散模型的推理时序扩展

计算机视觉与模式识别 2025-12-01 v1

摘要

我们探索在文本引导3D扩散模型中进行推理时序扩展,以提升生成质量,而无需额外训练。为此,我们引入ITS3D框架,将任务形式化为识别最有效高斯噪声输入的优化问题。该框架由验证器引导的搜索算法驱动,搜索算法根据验证器反馈不断细化噪声候选方案。为解决3D生成固有的挑战,我们引入三项技术以提升稳定性、效率和探索能力。1)应用高斯归一化以稳定搜索过程。当噪声候选方案在迭代更新中偏离标准高斯分布时,这会纠正分布偏移。2)高维3D搜索空间的稀疏性增加了计算复杂度。为缓解这一问题,采用奇异值分解压缩技术,以保留有效搜索方向的方式降低维度。3)为进一步防止收敛到次优局部最小值,引入奇异空间重置机制,基于多样性度量动态更新搜索空间。广泛的实验表明,ITS3D提升了文本到3D生成质量,显示了计算效率搜索方法在生成过程中的潜力。源代码可在https://github.com/ZhenglinZhou/ITS3D 获取。

关键词

引用

@article{arxiv.2511.22456,
  title  = {ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models},
  author = {Zhenglin Zhou and Fan Ma and Xiaobo Xia and Hehe Fan and Yi Yang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2511.22456},
  year   = {2025}
}

备注

25 pages, 11 figures