GesPrompt:利用协同语音手势增强虚拟现实中基于LLM的交互
人机交互
2025-05-09 v1
摘要
基于大语言模型(LLM)的副驾驶在扩展现实(XR)应用中展现了巨大潜力。然而,用户在向副驾驶描述3D环境时面临挑战,因为仅通过文本或语音传达时空信息的复杂性很高。为解决这一问题,我们引入了GesPrompt,一个将协同语音手势与语音相结合的多模态XR界面,使终端用户能够在XR环境中更自然、更准确地与基于LLM的副驾驶进行通信。通过融入手势,GesPrompt从协同语音手势中提取时空参考,减少了对精确文本提示的需求,并降低了终端用户的认知负荷。我们的贡献包括(1)一种在XR环境中集成手势和语音输入的工作流程,(2)实现该工作流程的VR原型系统,以及(3)一项证明其在改善VR环境中用户通信有效性方面的用户研究。
引用
@article{arxiv.2505.05441,
title = {GesPrompt: Leveraging Co-Speech Gestures to Augment LLM-Based Interaction in Virtual Reality},
author = {Xiyun Hu and Dizhi Ma and Fengming He and Zhengzhe Zhu and Shao-Kang Hsia and Chenfei Zhu and Ziyi Liu and Karthik Ramani},
journal= {arXiv preprint arXiv:2505.05441},
year = {2025}
}