中文

面向自然监督的3D视觉 grounding:基于语言正则化的概念学习器

计算机视觉与模式识别 2024-05-01 v1 人工智能 计算与语言 机器学习

摘要

3D视觉 grounding是一项具有挑战性的任务,通常需要直接且密集的监督,尤其是场景中每个物体的语义标签。本文研究了在仅使用3D场景和问答对(QA pairs)进行自然监督的设置下的方法,现有方法在此场景下表现不佳。我们提出了语言正则化概念学习器(Language-Regularized Concept Learner, LARC),通过语言约束作为正则化手段,显著提高了在自然监督设置下,神经符号概念学习器的准确率。我们的 метод基于两个核心见解:首先,语言约束(例如,一个词与另一个词的关系)可作为神经符号模型中结构化表示的有效正则化;其次,我们可以查询大型语言模型,从语言属性中提炼出此类约束。我们表明,LARC在自然监督的3D视觉 grounding任务中提升了现有方法的性能,并展示了其在广泛的3D视觉推理能力——从零样本组合,到数据效率和可迁移性。我们的 方法是一种迈向利用语言先验正则化结构化视觉推理框架,以实现无需稠密监督学习的有前景的步骤。

关键词

引用

@article{arxiv.2404.19696,
  title  = {Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners},
  author = {Chun Feng and Joy Hsu and Weiyu Liu and Jiajun Wu},
  journal= {arXiv preprint arXiv:2404.19696},
  year   = {2024}
}

备注

CVPR 2024. The first two authors contributed equally