中文

ClickAIXR:扩展现实中基于实物对象的设备内多模态视觉语言交互

计算机视觉与模式识别 2026-04-07 v1 图形学 人机交互

摘要

我们提出 ClickAIXR,一个面向扩展现实(XR)中与实物对象进行多模态视觉语言交互的设备内框架。不同于依赖云端 AI(如 ChatGPT)或基于凝视选择(如 GazePointAR)的先前系统,ClickAIXR 将设备内视觉语言模型(VLM)与基于控制器的对象选择范式集成,使用户能够在XR中精确点击实物对象。选中后,该对象图像将由VLM在本地处理,以通过文本和语音回答自然语言问题。这种以对象为中心的交互减少了基于凝视或语音唯一接口固有的歧义,并通过在设备内执行所有推理来提高透明度, addressing 隐私和延迟方面的顾虑。我们在 Magic Leap SDK(C API)中实现了 ClickAIXR,并使用 ONNX 实现本地 VLM 推理。我们进行了用户研究,将 ClickAIXR 与 Gemini 2.5 Flash 和 ChatGPT 5 进行比较,评估了可用性、可信度和用户满意度。结果显示,延迟适中,用户体验令人接受。我们的发现表明,基于点击的对象选择结合设备内 AI 有望推动可靠、隐私保护的XR交互。源代码和补充材料可在 nanovis.org/ClickAIXR.html 获取。

关键词

引用

@article{arxiv.2604.04905,
  title  = {ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality},
  author = {Dawar Khan and Alexandre Kouyoumdjian and Xinyu Liu and Omar Mena and Dominik Engel and Ivan Viola},
  journal= {arXiv preprint arXiv:2604.04905},
  year   = {2026}
}