中文

通过扩散排序进行 3D 描述的视角选择

计算机视觉与模式识别 2025-12-30 v3

摘要

可扩展的标注方法对于构建大规模 3D-文本数据集至关重要,可促进更广泛的应用。然而,现有方法有时会导致生成幻觉描述,从而损害描述质量。本文探讨了 3D 物体描述中的幻觉问题,重点关注 Cap3D 方法,该方法将 3D 物体渲染为 2D 视图并使用预训练模型进行描述。我们指出了一个主要挑战:3D 物体的某些渲染视图是非典型的,偏离了标准图像描述模型的训练数据并导致幻觉。为了解决这个问题,我们提出了 DiffuRank,一种利用预训练文本到 3D 模型来评估 3D 物体与其 2D 渲染视图之间对齐程度的方法,其中对齐程度高的视图能紧密代表物体的特征。通过对所有渲染视图进行排序并将排名最高的视图输入 GPT4-Vision,我们提高了描述的准确性和细节,能够纠正 Cap3D 数据集中的 20 万条描述,并将其扩展到 Objaverse 和 Objaverse-XL 数据集上的 100 万条描述。此外,我们展示了 DiffuRank 的适应性,将其应用于预训练文本到图像模型以执行视觉问答任务,在该任务中它优于 CLIP 模型。

关键词

引用

@article{arxiv.2404.07984,
  title  = {View Selection for 3D Captioning via Diffusion Ranking},
  author = {Tiange Luo and Justin Johnson and Honglak Lee},
  journal= {arXiv preprint arXiv:2404.07984},
  year   = {2025}
}

备注

Dataset link: https://huggingface.co/datasets/tiange/Cap3D