中文

面向视图一致文本到三维生成的结构能量引导

计算机视觉与模式识别 2026-05-20 v1

摘要

基于扩散模型的文本到三维生成常常面临 Janus 问题,导致不同视点下的几何形状不一致。本工作将二维扩散先验中的视点偏差识别为主要原因,并提出了结构能量引导采样(SEGS),这是一个无需训练且即插即用的框架,用于改善多视图一致性。SEGS 在 U-Net 特征的 PCA 子空间中构建结构能量,并将其梯度注入去噪过程。它可以轻松集成到 SDS/VSD 流程中,无需重新训练。实验表明,SEGS 平均将 Janus 率降低了约 10%,并在包括 DreamFusion、Magic3D 和 LucidDreamer 在内的多个基线上提高了 View-CS 分数。该方法有效地减轻了视点伪影,同时保持了外观保真度,为高质量文本到三维内容生成提供了一种灵活的解决方案。

关键词

引用

@article{arxiv.2605.19876,
  title  = {Structural Energy Guidance for View-Consistent Text-to-3D Generation},
  author = {Qing Zhang and Jinguang Tong and Jing Zhang and Jie Hong and Xuesong Li},
  journal= {arXiv preprint arXiv:2605.19876},
  year   = {2026}
}

备注

arXiv admin note: substantial text overlap with arXiv:2508.16917