中文

基于预训练模型的可扩展三维标注生成

计算机视觉与模式识别 2023-06-19 v2

摘要

我们提出 Cap3D,一种为三维物体自动生成描述性文本的框架。该方法利用图像标注、图像-文本对齐以及 LLM 等预训练模型,整合三维资产多视角下的标注,完全规避了耗时且昂贵的人工标注过程。我们将 Cap3D 应用于近期发布的大规模三维数据集 Objaverse,生成了 66 万组三维-文本对。基于同一数据集的 4.1 万条人工标注进行的评估表明,Cap3D 在质量、成本和速度上均优于人工撰写的描述。通过有效的提示工程,Cap3D 在 ABO 数据集收集的 1.7 万条标注上生成几何描述的能力可与人类表现相媲美。最后,我们在 Cap3D 与人工标注上微调文本到三维模型,结果显示 Cap3D 表现更优,并对包括 Point-E、Shape-E 和 DreamFusion 在内的 SOTA 进行了基准测试。

关键词

引用

@article{arxiv.2306.07279,
  title  = {Scalable 3D Captioning with Pretrained Models},
  author = {Tiange Luo and Chris Rockwell and Honglak Lee and Justin Johnson},
  journal= {arXiv preprint arXiv:2306.07279},
  year   = {2023}
}

备注

Dataset link: https://huggingface.co/datasets/tiange/Cap3D