中文

教育 LLM 看见并引导:增强现实中的情境感知实时辅助

人机交互 2025-11-18 v4

摘要

增强现实(AR)和虚拟现实(VR)技术在产业培训和现场作业辅助中的应用日益增长,为智能、情境感知支持系统创造了新的机遇。随着 worker 在 AR 和 VR 中执行复杂任务,这些设备捕获丰富的多模态数据,包括注视、手部动作和任务进程,可实时揭示用户意图和任务状态。有效地利用这些信息仍是一个主要挑战。本文提出一种情境感知型大语言模型(LLM)助手,将多种数据模态(如手部动作、任务步骤和对话历史)整合到统一框架中,用于实时问答。为系统研究情境如何影响性能,我们引入渐进式提示框架,每个模型版本接收的情境输入逐渐更丰富。使用记录 AR 指导任务执行的 HoloAssist 数据集,我们评估了每种模态对助手效果的贡献。我们的实验表明,纳入多模态情境显著提高了响应的准确性和相关性。这些发现突显了 LLM 驱动的多模态集成潜力,以实现适用于 AR 和 VR 基于产业培训和辅助的自适应、直观辅助的可能性。

关键词

引用

@article{arxiv.2511.00730,
  title  = {Teaching LLMs to See and Guide: Context-Aware Real-Time Assistance in Augmented Reality},
  author = {Mahya Qorbani and Kamran Paynabar and Mohsen Moghaddam},
  journal= {arXiv preprint arXiv:2511.00730},
  year   = {2025}
}

备注

This work has been submitted to the IEEE Transactions on Systems, Man, and Cybernetics: Systems for possible publication