SeMv-3D:面向通用文本到 3D 生成的语义与多视角一致性并行
计算机视觉与模式识别
2025-05-22 v2
摘要
通用文本到 3D (General Text-to-3D, GT23D) 生成对于创建跨对象和场景的多样化 3D 内容至关重要,却面临两个关键挑战:1) 确保输入文本与生成的 3D 模型之间的语义一致性,2) 在 3D 中保持不同视角之间的多视角一致性。现有方法通常仅解决上述这两个挑战中的一个,往往导致语义忠实度和结构一致性方面效果不佳。为克服这些限制,我们提出了 SeMv-3D,一种新的框架,用于联合增强 GT23D 生成中的语义对齐和多视角一致性。其核心,我们引入了三平面先验学习 (Triplane Prior Learning, TPL),通过专门的正交注意力机制捕获三个正交平面之间的空间对应关系,从而确保不同视角之间的几何一致性。此外,我们提出了基于先验的三平面语义对齐 (Prior-based Semantic Aligning in Triplanes, SAT),该方法利用基于注意力的特征对齐来强化文本语义与三平面表示之间的对应关系。大量实验表明,我们的方法在多视角一致性方面取得了新的状态突破 (state-of-the-art),同时在语义一致性方面保持了与仅关注语义对齐的方法的竞争性能。这些结果突显了我们方法在两个维度上有效平衡并卓越的能力,为该领域建立了新的基准。
引用
@article{arxiv.2410.07658,
title = {SeMv-3D: Towards Concurrency of Semantic and Multi-view Consistency in General Text-to-3D Generation},
author = {Xiao Cai and Pengpeng Zeng and Lianli Gao and Sitong Su and Heng Tao Shen and Jingkuan Song},
journal= {arXiv preprint arXiv:2410.07658},
year = {2025}
}