Gestura:基于大型视觉语言模型的系统,桥接运动与语义,实现实时自由形式手势理解
计算机视觉与模式识别
2025-11-07 v2 人工智能
摘要
自由形式手势理解在人机交互中备受推崇,因为它解放了用户对预定义手势类别的限制。然而,现有唯一解决方案GestureGPT识别准确率有限且响应速度慢。在本文中,我们提出Gestura,一个用于自由形式手势理解的端到端系统。Gestura利用预训练的大型视觉语言模型(LVLM)将高度动态和多样化的自由形式手势模式与高层语义概念对齐。为更好地捕捉不同风格下的细微手部动作,我们引入手部关键点处理模块,通过嵌入解剖学手部先验知识来弥补LVLMs缺乏细粒度领域知识的不足。进一步,链式思考(CoT)推理策略实现逐步语义推断,将浅层知识转化为深层语义理解,显著提升模型解释模糊或非标准手势的能力。这些组件共同使Gestura能够实现稳健且适应性强的自由形式手势理解。此外,我们开发了首个面向自由形式手势意图推理与理解的开源数据集,包含超过30万对标注的问答对。
引用
@article{arxiv.2510.21814,
title = {Gestura: A LVLM-Powered System Bridging Motion and Semantics for Real-Time Free-Form Gesture Understanding},
author = {Zhuoming Li and Aitong Liu and Mengxi Jia and Yubi Lu and Tengxiang Zhang and Changzhi Sun and Dell Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2510.21814},
year = {2025}
}
备注
IMWUT2025