MARVEL-40M+: 用于高保真文本到3D内容创建的多级视觉详化
计算机视觉与模式识别
2025-03-27 v2 人工智能
图形学
机器学习
摘要
从文本提示生成高保真3D内容在计算机视觉中仍是一个显著的挑战,主要由于现有数据集规模有限、样本多样性不足以及注释深度不足。为此,我们引入MARVEL-40M+,一个包含4000万条文本注释,涵盖来自七大3D数据集的超过890万个3D资产。我们的贡献在于构建一种新型的多阶段注释流程,集成开源预训练的多视角视觉语言模型和大语言模型,自动生成从详细描述(150-200字)到简洁语义标签(10-20字)的多层次描述。这种结构既支持精细的3D重建,也适用于快速原型设计。此外,我们将源数据集中的人类元数据纳入注释流程,以添加领域特定信息并减少VLM的幻觉现象。我们还开发了MARVEL-FX3D,一个两阶段的文本到3D流程。我们对稳定扩散模型进行微调,并使用预训练的图像到3D网络,在15秒内生成3D纹理网格。广泛的评估表明,MARVEL-40M+在注释质量和语言多样性方面显著优于现有数据集,分别以GPT-4和人类评估者的72.41%和73.40%的胜率通过评估。项目页面可在https://sankalpsinha-cmos.github.io/MARVEL/访问。
引用
@article{arxiv.2411.17945,
title = {MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content Creation},
author = {Sankalp Sinha and Mohammad Sadil Khan and Muhammad Usama and Shino Sam and Didier Stricker and Sk Aziz Ali and Muhammad Zeshan Afzal},
journal= {arXiv preprint arXiv:2411.17945},
year = {2025}
}