中文

Droplet3D:来自视频的常识先验促进三维生成

计算机视觉与模式识别 2025-08-29 v1

摘要

缩放定律验证了大数据训练模型在文本、图像和视频领域创意生成中的成功与前景。然而,这一范式在3D领域面临数据稀缺问题,因为互联网上可用的3D数据远少于上述模态。幸运的是,存在大量天然包含常识先验的视频,提供了替代的监督信号以缓解因原生3D数据有限导致的泛化瓶颈。一方面,捕捉物体或场景多视角的视频为3D生成提供了空间一致性先验;另一方面,视频中丰富的语义信息使生成内容更忠实于文本提示且语义合理。本文探讨了如何将视频模态应用于3D资产生成,涵盖从数据集到模型。我们引入Droplet3D-4M,首个具有多视角级别标注的大规模视频数据集,并训练了Droplet3D,一个支持图像和密集文本输入的生成模型。大量实验验证了我们方法的有效性,展示了其生成空间一致且语义合理内容的能力。此外,与主流的3D解决方案不同,我们的方法展现出扩展至场景级应用的潜力。这表明来自视频的常识先验显著促进了3D创作。我们已开源所有资源,包括数据集、代码、技术框架和模型权重:https://dropletx.github.io/。

关键词

引用

@article{arxiv.2508.20470,
  title  = {Droplet3D: Commonsense Priors from Videos Facilitate 3D Generation},
  author = {Xiaochuan Li and Guoguang Du and Runze Zhang and Liang Jin and Qi Jia and Lihua Lu and Zhenhua Guo and Yaqian Zhao and Haiyang Liu and Tianqi Wang and Changsheng Li and Xiaoli Gong and Rengang Li and Baoyu Fan},
  journal= {arXiv preprint arXiv:2508.20470},
  year   = {2025}
}