MISAR:一种基于增强现实的多模态指令系统
计算与语言
2023-10-19 v1 计算机视觉与模式识别
摘要
增强现实(AR)需要无缝整合视觉、听觉与语言通道以实现优化的人机交互。尽管听觉与视觉输入有助于实时且情境化的用户引导,但大语言模型(LLMs)在此领域中的潜力在很大程度上尚未被发掘。我们的研究引入了一种创新方法,利用 LLMs 来吸收来自视觉、听觉与情境模态的信息。针对 AR 中任务表现量化的独特挑战,我们运用以自我为中心的视频、语音与情境分析。LLMs 的整合促进了状态估计的增强,标志着向更具适应性的 AR 系统迈进了一步。代码、数据集与演示将于 https://github.com/nguyennm1024/misar 提供。
引用
@article{arxiv.2310.11699,
title = {MISAR: A Multimodal Instructional System with Augmented Reality},
author = {Jing Bi and Nguyen Manh Nguyen and Ali Vosoughi and Chenliang Xu},
journal= {arXiv preprint arXiv:2310.11699},
year = {2023}
}
备注
Accepted at ICCV 2023 - AV4D, 6 figures, 2 tables