引导现实:利用大语言模型和视觉模型生成富有视觉元素的 AR 任务指导
人机交互
2025-09-25 v2
摘要
大语言模型(LLMs)已实现对广泛物理任务的逐步 augmented reality(AR)指令自动生成。然而,现有的 LLM-based AR 指导缺乏丰富的视觉增强,难以将指令嵌入空间语境以实现更好的用户理解。我们提出 Guided Reality,一个完全自动化的 AR 系统,生成基于逐步指令的嵌入式和动态视觉指导。我们的系统集成 LLM 和视觉模型,以:1)从用户查询生成多步骤指令,2)识别合适的视觉指导类型,3)提取关于关键交互点在现实世界中的空间信息,4)在物理空间中嵌入视觉指导以支持任务执行。我们基于用户手册语料库定义了五类视觉指导,并提出一种基于当前步骤的识别策略。我们通过用户实验(N=16)完成了实际任务并在野外探索系统。此外,四位 instructor 分享了 Guided Reality 如何融入其培训工作流程的见解。
引用
@article{arxiv.2508.03547,
title = {Guided Reality: Generating Visually-Enriched AR Task Guidance with LLMs and Vision Models},
author = {Ada Yi Zhao and Aditya Gunturu and Ellen Yi-Luen Do and Ryo Suzuki},
journal= {arXiv preprint arXiv:2508.03547},
year = {2025}
}
备注
To appear at UIST 2025