中文

GazePointAR:面向可穿戴增强现实中代词消歧的上下文感知多模态语音助手

人机交互 2025-11-25 v1

摘要

诸如 Siri 和 Alexa 等语音助手 正在改变人机交互;然而,它们缺乏对用户时空上下文的感知,导致性能受限且对话不自然。我们引入了 GazePointAR,这是一个面向可穿戴增强现实的功能完备的上下文感知语音助手,它利用视线注视、指示手势和对话历史来消除语音查询的歧义。借助 GazePointAR,用户只需通过注视和/或指示即可询问“那边是什么?”或“我该如何解决这道数学题?”。我们在一项分为三部分的实验室研究 (N=12) 中评估了 GazePointAR:(1) 将 GazePointAR 与两个商业系统进行比较;(2) 检验 GazePointAR 在三项任务中的代词消歧能力;(3) 以及一个开放性阶段,参与者可以提出并尝试自己的上下文敏感查询。参与者赞赏代词驱动查询的自然性和类人特性,尽管有时代词的使用有悖直觉。随后我们对 GazePointAR 进行了迭代,并开展了一项第一人称日记研究,以检验 GazePointAR 在真实环境中的表现。最后,我们列举了未来上下文感知语音助手的局限性与设计考量。

关键词

引用

@article{arxiv.2404.08213,
  title  = {GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality},
  author = {Jaewook Lee and Jun Wang and Elizabeth Brown and Liam Chu and Sebastian S. Rodriguez and Jon E. Froehlich},
  journal= {arXiv preprint arXiv:2404.08213},
  year   = {2025}
}