ConsDreamer:用于零样本文本到 3D 生成的多视图一致性方法
计算机视觉与模式识别
2026-04-28 v4 人工智能
摘要
近期零样本文本到 3D 生成技术的进展彻底革新了 3D 内容创建,使其能够直接从文本描述中合成。虽然领先的方法利用 3D 高斯溶解与得分蒸馏来增强多视图渲染,但通过预训练的文本到图像(T2I)模型,这些方法受制于 T2I 先验中固有的 prior view biases,导致 3D 生成不一致,尤其体现在多面团盘问题(multi-face Janus problem),即对象在不同视图中呈现出冲突的特征。为解决这一根本性挑战,我们提出 ConsDreamer,一种通过细化 score distillation 过程中条件项和无条件项以减轻 view bias 的新方法:(1) 视图解�合模块(VDM),通过解耦无关的 view 组件并注入精确的 view 控制来消除条件提示中的姿态偏差;(2) 基于相似性的部分序 loss,用于通过对齐余弦相似性与方位角关系来实现无条件项中几何一致性。广泛的实验表明,ConsDreamer 可以无缝集成到各种 3D 表示和得分蒸馏范式中,有效缓解了多面团盘问题。
引用
@article{arxiv.2504.02316,
title = {ConsDreamer: Advancing Multi-View Consistency for Zero-Shot Text-to-3D Generation},
author = {Yuan Zhou and Shilong Jin and Litao Hua and Wanjun Lv and Haoran Duan and Jungong Han},
journal= {arXiv preprint arXiv:2504.02316},
year = {2026}
}
备注
Accepted by IEEE Transactions on Image Processing, Code is available at: https://github.com/GAInuist/ConsDreamer