GestureGPT:基于大语言模型智能体实现零样本自由形式手势理解
计算与语言
2024-11-05 v5 人机交互
摘要
现有手势交互接口仅能识别由接口设计者或用户自身定义的固定手势集合,这带来了学习或演示成本,削弱了其自然性。相比之下,人类通过综合手势、情境、经验与常识来理解自由形式手势,用户无需学习、演示或关联手势。我们提出 GestureGPT,一种模仿人类手势理解过程以实现自然自由形式手势交互接口的自由形式手部手势理解框架。我们的框架利用多个大语言模型(LLM)智能体来管理与综合手势及情境信息,进而通过将手势与接口功能相关联来推断交互意图。更具体地,我们的三智能体框架包含一个手势描述智能体,其基于手部关键点坐标自动分割并生成手部姿态与运动的自然语言描述。该描述由手势推断智能体通过自我推理与查询交互情境(如交互历史、注视数据)来解读,而情境由情境管理智能体管理。经迭代交换后,手势推断智能体通过将意图锚定至交互功能来辨识用户意图。我们在两种真实场景——智能家居控制与在线视频播放——下离线验证了框架。零样本 Top-1/Top-5 锚定准确率在智能家居任务上分别为 44.79%/83.59%,在视频播放任务上分别为 37.50%/73.44%。我们还提供了包含模型选择依据、泛化性及实用系统未来研究方向等内容的详尽讨论。
引用
@article{arxiv.2310.12821,
title = {GestureGPT: Toward Zero-Shot Free-Form Hand Gesture Understanding with Large Language Model Agents},
author = {Xin Zeng and Xiaoyu Wang and Tengxiang Zhang and Chun Yu and Shengdong Zhao and Yiqiang Chen},
journal= {arXiv preprint arXiv:2310.12821},
year = {2024}
}
备注
This paper has been accepted to the ISS 2024 track of the Proceedings of the ACM on Human-Computer Interaction