ImaGGen:面向语言和图像输入的零样态共语义手势生成
人机交互
2025-10-21 v1 计算机视觉与模式识别
摘要
人类交流结合语言与非语言手势,这些手势在多种交际功能中发挥作用。然而,当前的手势生成方法受限于简单重复的节拍手势,这些手势仅伴随说话节奏,不贡献于传递语义信息。本文解决共语手势合成的核心挑战:生成与口语言语内容语义一致的象征性或指示性手势。此类手势不能仅从语言输入派生——语言本身缺乏常由手势独立承载的视觉意义。我们因此引入一个零样态系统,从给定语言输入生成手势,并受 imagistic 输入信息增强,无需人工标注或人工干预。该方法集成了图像分析管道,提取关键对象属性(如形状、对称性和对齐方式),并通过语义匹配模块将这些视觉细节与 spoken text 关联。随后,逆运动学引擎合成象征性和指示性手势,并与共生成的自然节拍手势组合,实现连贯的多模态交际。综合的用户研究证明了我们方法的有效性。在 speech alone 模糊不清的场景中,本文生成的手势显著提高了受试者识别对象属性的能力,确认了其可解释性和交际价值。尽管在表示复杂形状方面仍存在挑战,但我们的结果凸显了面向创造性和协作虚拟代理或 avatar 的 context-aware 语义手势的重要性,标志着向高效稳健的具身人机交互迈出了 substantial 步进。更多信息和示例视频请访问:https://review-anon-io.github.io/ImaGGen.github.io/
引用
@article{arxiv.2510.17617,
title = {ImaGGen: Zero-Shot Generation of Co-Speech Semantic Gestures Grounded in Language and Image Input},
author = {Hendric Voss and Stefan Kopp},
journal= {arXiv preprint arXiv:2510.17617},
year = {2025}
}