MOC-3D:基于语义视图序一致性的文本到3D生成
计算机视觉与模式识别
2026-05-05 v1 多媒体
摘要
随着元宇宙、虚拟现实(VR)和数字孪生等领域的快速发展,文本到3D生成已成为学术界和产业界的研究热点。当前基于基于得分蒸馏抽样(SDS)利用2D扩散先验的优化方法已成为该领域主流技术范式。然而,由于2D先验的视图偏见以及高分类器自由指导(CFG)导致的模式寻优歧义和梯度噪声,这些方法仍 suffer宏观拓扑不一致(如Janus问题)和微观几何连续性问题。为此,我们提出MOC-3D,一种基于几何流形和语义视图序一致性的文本到3D生成方法。基于ScaleDreamer框架构建, our方法包含语义视图序约束模块和基于流形的特征连续性模块。前者旨在纠正宏观拓扑不一致,后者专注于消除微观几何连续性。具体而言,语义视图序约束模块利用CLIP的先验知识,在不同视图的语义得分表征上施加单调排序约束,从而为3D对象的全局拓扑结构提供有效指导。与此同时,基于流形的特征连续性模块运用对称正定(SPD)流形上的黎曼度量。通过衡量黎曼空间中特征统计分布的距离,它促进了跨多视图的微纹理在统计意义上的平滑演化和连续性。在这两个模块对宏观-微观协同优化下,our模型能够同时提高宏观结构一致性和微观细节连续性。
引用
@article{arxiv.2605.01743,
title = {MOC-3D: Manifold-Order Consistency for Text-to-3D Generation},
author = {Chenyang Fan and Junshi Cheng and Wen Yang and Zihong Li and Wenfeng Zhang and Wei Hu and Yi Zhang and Pan Zeng},
journal= {arXiv preprint arXiv:2605.01743},
year = {2026}
}