利用基于 VLM 的流程标注 3D 物体
计算机视觉与模式识别
2024-06-18 v2
摘要
预训练的视觉语言模型(VLMs)提供了大规模地为无标注 3D 物体生成描述的机会。从不同视角汇总 VLM 描述的主流方法(Luo et al., 2023)依赖语言模型(GPT4)生成最终输出。这种基于文本的聚合容易因合并可能矛盾的描述而产生幻觉。我们提出了一种替代算法,对视角等影响 VLM 响应的因素进行边缘化。我们利用 VLM 的联合图像-文本似然,而非合并纯文本响应。我们表明我们的概率聚合不仅更可靠、更高效,而且在依据人工核验标签推断物体类型方面确立了 SOTA。聚合后的标注对条件推断也有用;当将物体类型作为辅助文本输入指定时,它们改善了下游预测(例如物体材质)。此类辅助输入允许在无监督设定下消融视觉推理相对于无视觉推理的贡献。通过这些有监督与无监督评估,我们展示了如何借助基于 VLM 的流程为 Objaverse 数据集中的 764K 个物体生成可靠标注。
引用
@article{arxiv.2311.17851,
title = {Leveraging VLM-Based Pipelines to Annotate 3D Objects},
author = {Rishabh Kabra and Loic Matthey and Alexander Lerchner and Niloy J. Mitra},
journal= {arXiv preprint arXiv:2311.17851},
year = {2024}
}