面向视图一致文本到三维生成的结构能量引导
计算机视觉与模式识别
2026-05-20 v1
摘要
基于扩散模型的文本到三维生成常常面临 Janus 问题,导致不同视点下的几何形状不一致。本工作将二维扩散先验中的视点偏差识别为主要原因,并提出了结构能量引导采样(SEGS),这是一个无需训练且即插即用的框架,用于改善多视图一致性。SEGS 在 U-Net 特征的 PCA 子空间中构建结构能量,并将其梯度注入去噪过程。它可以轻松集成到 SDS/VSD 流程中,无需重新训练。实验表明,SEGS 平均将 Janus 率降低了约 10%,并在包括 DreamFusion、Magic3D 和 LucidDreamer 在内的多个基线上提高了 View-CS 分数。该方法有效地减轻了视点伪影,同时保持了外观保真度,为高质量文本到三维内容生成提供了一种灵活的解决方案。
引用
@article{arxiv.2605.19876,
title = {Structural Energy Guidance for View-Consistent Text-to-3D Generation},
author = {Qing Zhang and Jinguang Tong and Jing Zhang and Jie Hong and Xuesong Li},
journal= {arXiv preprint arXiv:2605.19876},
year = {2026}
}
备注
arXiv admin note: substantial text overlap with arXiv:2508.16917