中文

MISAR:一种基于增强现实的多模态指令系统

计算与语言 2023-10-19 v1 计算机视觉与模式识别

摘要

增强现实(AR)需要无缝整合视觉、听觉与语言通道以实现优化的人机交互。尽管听觉与视觉输入有助于实时且情境化的用户引导,但大语言模型(LLMs)在此领域中的潜力在很大程度上尚未被发掘。我们的研究引入了一种创新方法,利用 LLMs 来吸收来自视觉、听觉与情境模态的信息。针对 AR 中任务表现量化的独特挑战,我们运用以自我为中心的视频、语音与情境分析。LLMs 的整合促进了状态估计的增强,标志着向更具适应性的 AR 系统迈进了一步。代码、数据集与演示将于 https://github.com/nguyennm1024/misar 提供。

关键词

引用

@article{arxiv.2310.11699,
  title  = {MISAR: A Multimodal Instructional System with Augmented Reality},
  author = {Jing Bi and Nguyen Manh Nguyen and Ali Vosoughi and Chenliang Xu},
  journal= {arXiv preprint arXiv:2310.11699},
  year   = {2023}
}

备注

Accepted at ICCV 2023 - AV4D, 6 figures, 2 tables