中文

GestLLM:通过大语言模型实现高级手势解释以用于人机交互

机器人学 2025-01-16 v2

摘要

本文介绍了GestLLM,一种先进的人机交互系统,能够通过手势实现直观的机器人控制。与依赖有限预定义手势的传统系统不同,GestLLM利用大语言模型和通过MediaPipe进行的特征提取来解释多样化的手势。这种集成解决了现有系统中的关键限制,例如手势灵活性受限以及无法识别人类交流中常用的复杂或非常规手势。通过结合最先进的特征提取和语言模型能力,GestLLM在性能上可与领先的视觉-语言模型相媲美,同时支持传统数据集中代表性不足的手势。例如,这包括来自流行文化的手势,如《星际迷航》中的“瓦肯举手礼”,而无需任何额外的预训练、提示工程等。这种灵活性增强了机器人控制的自然性和包容性,使交互更加直观和用户友好。GestLLM在手势交互方面迈出了重要一步,使机器人能够有效理解和响应各种手势。本文概述了其设计、实现和评估,展示了其在高级人机协作、辅助机器人和交互式娱乐中的潜在应用。

关键词

引用

@article{arxiv.2501.07295,
  title  = {GestLLM: Advanced Hand Gesture Interpretation via Large Language Models for Human-Robot Interaction},
  author = {Oleg Kobzarev and Artem Lykov and Dzmitry Tsetserukou},
  journal= {arXiv preprint arXiv:2501.07295},
  year   = {2025}
}