Omni123:通过统一文本到2D和3D生成探索有限3D数据下的3D原生基础模型
计算机视觉与模式识别
2026-04-03 v1 人工智能
摘要
近期多模态大语言模型在统一文本和图像理解与生成方面取得了强劲性能,但将这种原生能力扩展到3D仍然具有挑战性,原因在于数据有限。与丰富的2D图像相比,高质量3D资产稀缺,使得3D合成欠约束。现有方法通常依赖间接流水线,即在2D中编辑并通过优化将结果提升到3D,从而牺牲了几何一致性。我们提出Omni123,一个3D原生基础模型,在单一自回归框架中统一了文本到2D和文本到3D生成。我们的关键洞察是,图像与3D之间的跨模态一致性可以作为隐式结构约束。通过将文本、图像和3D表示为共享序列空间中的离散token,模型利用丰富的2D数据作为几何先验来改进3D表示。我们引入了一种交错X-to-X训练范式,在异构配对数据集上协调多样化的跨模态任务,而无需完全对齐的文本-图像-3D三元组。通过在自回归序列中遍历语义-视觉-几何循环(例如,文本到图像到3D到图像),模型联合强制语义对齐、外观保真度和多视图几何一致性。实验表明,Omni123显著改进了文本引导的3D生成和编辑,展示了一条通向多模态3D世界模型的可扩展路径。
引用
@article{arxiv.2604.02289,
title = {Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation},
author = {Chongjie Ye and Cheng Cao and Chuanyu Pan and Yiming Hao and Yihao Zhi and Yuanming Hu and Xiaoguang Han},
journal= {arXiv preprint arXiv:2604.02289},
year = {2026}
}