中文

ForgeDreamer:基于多专家 LoRA 和跨视图超图的工业文本到 3D 生成

计算机视觉与模式识别 2026-04-02 v4

摘要

当前文本到 3D 生成方法在自然场景中表现优异,但在工业应用方面因两个关键局限性而难以胜任:域适应挑战,其中常规 LoRA 融合会导致跨类别知识相互干扰;几何推理不足,其中二元一致性约束无法捕捉精密制造所必需的高阶结构依赖。我们提出一种名为 ForgeDreamer 的新型框架,通过两个关键创新来解决上述问题。首先,我们引入多专家 LoRA 集成机制,将多个类别特定 LoRA 模型整合为统一表示,实现卓越的跨类别泛化,消除知识干扰。其次,基于增强的语义理解,我们开发了跨视图超图几何增强方法,以捕捉跨越多个视角的结构依赖。这些组件协同工作,显著提升语义理解,使几何推理更为有效,同时超图建模确保制造级一致性。在自定义工业数据集上的大规模实验表明,ForgeDreamer 在语义泛化和几何保真度方面均优于最先进的方法。代码已公开于 https://github.com/Junhaocai27/ForgeDreamer。

关键词

引用

@article{arxiv.2603.09266,
  title  = {ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert LoRA and Cross-View Hypergraph},
  author = {Junhao Cai and Deyu Zeng and Junhao Pang and Lini Li and Zongze Wu and Xiaopin Zhong},
  journal= {arXiv preprint arXiv:2603.09266},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings!