中文

引导现实:利用大语言模型和视觉模型生成富有视觉元素的 AR 任务指导

人机交互 2025-09-25 v2

摘要

大语言模型(LLMs)已实现对广泛物理任务的逐步 augmented reality(AR)指令自动生成。然而,现有的 LLM-based AR 指导缺乏丰富的视觉增强,难以将指令嵌入空间语境以实现更好的用户理解。我们提出 Guided Reality,一个完全自动化的 AR 系统,生成基于逐步指令的嵌入式和动态视觉指导。我们的系统集成 LLM 和视觉模型,以:1)从用户查询生成多步骤指令,2)识别合适的视觉指导类型,3)提取关于关键交互点在现实世界中的空间信息,4)在物理空间中嵌入视觉指导以支持任务执行。我们基于用户手册语料库定义了五类视觉指导,并提出一种基于当前步骤的识别策略。我们通过用户实验(N=16)完成了实际任务并在野外探索系统。此外,四位 instructor 分享了 Guided Reality 如何融入其培训工作流程的见解。

关键词

引用

@article{arxiv.2508.03547,
  title  = {Guided Reality: Generating Visually-Enriched AR Task Guidance with LLMs and Vision Models},
  author = {Ada Yi Zhao and Aditya Gunturu and Ellen Yi-Luen Do and Ryo Suzuki},
  journal= {arXiv preprint arXiv:2508.03547},
  year   = {2025}
}

备注

To appear at UIST 2025