Idea23D:协作式大型多模态智能体实现从交错多模态输入生成3D模型
摘要
随着2D扩散模型的成功,2D AI生成内容(AIGC)已经改变了我们的生活。最近,这一成功模式扩展到3D AIGC,采用领先的方法从单张图片或文本生成带纹理的3D模型。然而,我们认为当前的3D AIGC方法仍未充分释放人类的创造力。我们常常会想象由多模态输入(例如:我的宠物兔子在桌上吃着曲奇)制成的3D内容。本文探索了一种新颖的3D AIGC方法:从IDEAS(由文本、图片和3D模型组成的多模态输入)生成3D内容。据我们了解,这种具有挑战性和活力的3D AIGC设定尚未有人研究过。我们提出了新的框架Idea23D,该框架结合了三个基于大型多模态模型(LMM)的智能体和现有算法工具。这三个LMM-based智能体分别负责提示生成、模型选择和反馈反思。它们在完全自动化的循环中协作并相互批评,无需人工干预。该框架随后生成文本提示,以创建与输入IDEAS高度吻合的3D模型。我们展示了超越前一方法的令人印象深刻的3D AIGC结果。为全面评估Idea23D的3D AIGC能力,我们引入了包含198个多模态输入的Eval3DAIGC-198数据集,用于评估生成的3D内容与输入IDEAS之间的对齐程度。我们的调查和量化结果表明,Idea23D在3D生成的成功率和准确性方面显著提高,能够在各种LMM、文本到图像和图像到3D模型之间实现良好的兼容性。代码和数据集已提供,访问地址为 \url{https://idea23d.github.io/}。
引用
@article{arxiv.2404.04363,
title = {Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs},
author = {Junhao Chen and Xiang Li and Xiaojun Ye and Chao Li and Zhaoxin Fan and Hao Zhao},
journal= {arXiv preprint arXiv:2404.04363},
year = {2024}
}
备注
Accepted by COLING 2025 (The 31st International Conference on Computational Linguistics) Project Page: https://idea23d.github.io/ Code: https://github.com/yisuanwang/Idea23D