OCTOPUS:利用混合现实中的语义理解进行开放词汇内容跟踪与物体放置
计算机视觉与模式识别
2023-12-21 v1 人工智能
计算与语言
摘要
增强现实的一个关键挑战是将虚拟内容放置在自然位置。现有的自动化技术仅能处理封闭词汇、固定集合的物体。在本文中,我们引入了一种用于物体放置的新开放词汇方法。我们的八阶段流程利用了分割模型、视觉 - 语言模型和大语言模型(LLMs)的最新进展,能够将任何虚拟物体放置在任何 AR 相机帧或场景中。在一项初步用户研究中,我们表明我们的方法至少在 57% 的情况下表现与人类专家相当。
引用
@article{arxiv.2312.12815,
title = {OCTOPUS: Open-vocabulary Content Tracking and Object Placement Using Semantic Understanding in Mixed Reality},
author = {Luke Yoffe and Aditya Sharma and Tobias Höllerer},
journal= {arXiv preprint arXiv:2312.12815},
year = {2023}
}
备注
IEEE International Symposium on Mixed and Augmented Reality (ISMAR) 2023