中文

JARVIS:基于 VLM 的即时增强现实指令系统用于跨现实任务指导

人机交互 2026-05-19 v3

摘要

许多日常任务依赖外部教程如说明书和视频,用户需不断在阅读指令和执行动作之间切换,这会破坏工作流程并增加认知负荷。增强现实 (AR) 能实现场景内指导,而最近大型语言模型 (LLM) 和视觉语言模型 (VLM) 的进展使得自动生成此类指导成为可能。然而,现有的 AI 驱动 AR 教学系统主要关注物理程序性任务,仅能为混合物理和虚拟工作空间提供有限支持。为填补这一空白,我们进行了跨现实任务的形式化研究,识别出状态感知和跨现实协调的关键需求。我们提出 JARVIS,一个 VLM 驱动的 AR 指令系统,可从单一提示生成情境化、分步指导,具备实时状态验证和自适应视觉反馈。为 inform 系统设计,我们进行了形式化研究以理解跨现实任务的指导需求,将其归类为四种类型:real-to-real (R2R)、real-to-virtual (R2V)、virtual-to-real (V2R) 和 virtual-to-virtual (V2V)。四个领域的 within-subject 研究 (N=14) 显示,JARVIS 在可用性、工作负荷、成功率和可视化效果方面均优于基线方法。

关键词

引用

@article{arxiv.2604.10108,
  title  = {JARVIS: A Just-in-Time Augmented Reality VLM-Powered Instruction System for Cross-Reality Task Guidance},
  author = {Yusi Sun and Ying Jiang and Jiayin Lu and Yin yang and Yong-Hong Kuo and Chenfanfu Jiang},
  journal= {arXiv preprint arXiv:2604.10108},
  year   = {2026}
}

备注

14 pages, 11 figures, 2 tables