基于预训练模型的可扩展三维标注生成
计算机视觉与模式识别
2023-06-19 v2
摘要
我们提出 Cap3D,一种为三维物体自动生成描述性文本的框架。该方法利用图像标注、图像-文本对齐以及 LLM 等预训练模型,整合三维资产多视角下的标注,完全规避了耗时且昂贵的人工标注过程。我们将 Cap3D 应用于近期发布的大规模三维数据集 Objaverse,生成了 66 万组三维-文本对。基于同一数据集的 4.1 万条人工标注进行的评估表明,Cap3D 在质量、成本和速度上均优于人工撰写的描述。通过有效的提示工程,Cap3D 在 ABO 数据集收集的 1.7 万条标注上生成几何描述的能力可与人类表现相媲美。最后,我们在 Cap3D 与人工标注上微调文本到三维模型,结果显示 Cap3D 表现更优,并对包括 Point-E、Shape-E 和 DreamFusion 在内的 SOTA 进行了基准测试。
引用
@article{arxiv.2306.07279,
title = {Scalable 3D Captioning with Pretrained Models},
author = {Tiange Luo and Chris Rockwell and Honglak Lee and Justin Johnson},
journal= {arXiv preprint arXiv:2306.07279},
year = {2023}
}
备注
Dataset link: https://huggingface.co/datasets/tiange/Cap3D