视觉语言模型能否理解和解释来自行人动态手势?面向协作型自动驾驶车辆的指令性非语言命令的 pilot 数据集与探索
计算机视觉与模式识别
2025-04-16 v1 人工智能
人机交互
摘要
在自动驾驶领域,正确解释交通手势(TG)至关重要,例如解释权威人士提供的命令或指令,或解释行人向司机示意,以确保所有道路用户都能获得安全、愉快的交通环境。本研究探讨了最先进的视觉语言模型(VLMs)在零样例解释方面的能力,专注于其对交通语境下人类手势的描述和分类能力。我们创建并公开分享了两个具有不同形式和非形式 TG 的自定义数据集,如 'Stop'、'Reverse'、'Hail' 等。数据集为 "Acted TG (ATG)" 和 "Instructive TG In-The-Wild (ITGI)"。它们标注了自然语言,描述行人的身体位置和手势。我们使用三种方法进行模型评估,利用专家生成的描述作为基线和控制:(1) 描述相似度,(2) 手势分类,(3) 位姐序列重建相似度。结果表明,当前 VLMs 在手势理解方面存在挑战:句子相似度平均低于 0.59,分类 F1 分数仅为 0.14-0.39,远低于专家基线的 0.70。尽管位姐重建显示出潜力,但需要更多数据和更精细的度量标准才能可靠。我们的发现表明,尽管某些 SOTA VLMs 可以解释零样例人类交通手势,但 none 足够准确和稳健,以至于可以被信任,这强调了该领域需要进一步研究的重要性。
引用
@article{arxiv.2504.10873,
title = {Can Vision-Language Models Understand and Interpret Dynamic Gestures from Pedestrians? Pilot Datasets and Exploration Towards Instructive Nonverbal Commands for Cooperative Autonomous Vehicles},
author = {Tonko E. W. Bossen and Andreas Møgelmose and Ross Greer},
journal= {arXiv preprint arXiv:2504.10873},
year = {2025}
}