SceneVerse:扩展3D视觉-语言学习以实现接地场景理解
计算机视觉与模式识别
2024-09-25 v3 人工智能
计算与语言
机器学习
机器人学
摘要
3D视觉-语言接地,专注于将语言与3D物理环境对齐,是具身智能体发展的基石。与2D领域的最新进展相比,在3D场景中接地语言面临若干重大挑战:(i) 由于多样的物体配置、丰富的属性和错综复杂的关系,3D场景具有固有的复杂性;(ii) 缺乏配对的3D视觉-语言数据来支持接地学习;(iii) 缺少统一的从接地3D数据中蒸馏知识的学习框架。在这项工作中,我们旨在通过考察在室内环境中系统性地大规模扩展3D视觉-语言学习的潜力,来应对3D视觉-语言领域的这三大挑战。我们引入了首个百万级规模的3D视觉-语言数据集SceneVerse,包含约68K个3D室内场景,并包含250万对源自人工标注和我们可扩展的基于场景图的生成方法的视觉-语言对。我们证明,这种规模扩展使得能够为3D视觉-语言学习构建一个统一的预训练框架——场景接地预训练(GPS)。通过大量实验,我们在所有现有的3D视觉接地基准上取得了最先进的性能,展示了GPS的有效性。SceneVerse和GPS的巨大潜力通过在具有挑战性的3D视觉-语言任务中的零样本迁移实验得以揭示。项目网站:https://scene-verse.github.io。
引用
@article{arxiv.2401.09340,
title = {SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding},
author = {Baoxiong Jia and Yixin Chen and Huangyue Yu and Yan Wang and Xuesong Niu and Tengyu Liu and Qing Li and Siyuan Huang},
journal= {arXiv preprint arXiv:2401.09340},
year = {2024}
}
备注
ECCV 2024