中文

多模态三维融合与原位学习:面向具备空间感知能力的 AI

人机交互 2024-10-08 v1 人工智能 计算机视觉与模式识别

摘要

虚拟与物理世界在增强现实中的无缝集成,依赖于系统对物理环境进行语义化“理解”。增强现实研究长期关注情境感知潜力,展示了利用三维环境语义进行多种对象级交互的新能力。同时,计算机视觉领域在神经视觉语言理解方面取得进展,提升了自主任务的环境感知能力。本文引入一种多模态三维对象表示,统一语义知识、语言知识与几何表示,实现面向物理对象的用户导向机器学习。我们首先提出快速的多模态三维重建流程,通过将CLIP视觉语言特征融合至环境与对象模型,实现语言理解在AR中的应用。随后,我们提出“原位”机器学习方法,结合多模态表示,为用户提供全新的工具与接口,以空间和语言的方式与物理空间及对象进行交互。我们通过在Magic Leap 2上的两个实际AR应用,展示了所提出系统的实用性:a) 利用自然语言在物理环境中进行空间搜索,b) 具备智能能源的系统,跟踪对象随时间的变化。我们也在https://github.com/cy-xu/spatially_aware_AI)上公开完整实现与演示数据,以鼓励进一步探索和研究空间感知 AI。

关键词

引用

@article{arxiv.2410.04652,
  title  = {Multimodal 3D Fusion and In-Situ Learning for Spatially Aware AI},
  author = {Chengyuan Xu and Radha Kumaran and Noah Stier and Kangyou Yu and Tobias Höllerer},
  journal= {arXiv preprint arXiv:2410.04652},
  year   = {2024}
}

备注

10 pages, 6 figures, accepted to IEEE ISMAR 2024