理解行人手势误识别:来自视觉-语言模型推理的洞见
人机交互
2025-08-19 v2
摘要
行人手势在交通通信中发挥着重要作用,尤其是在与自动驾驶车辆(AVs)的交互中,但其微妙、模糊且情境依赖的性质持续为机器解释带来挑战。本研究通过使用视觉-语言模型GPT-4V,不是作为性能基准,而是作为诊断工具来揭示手势误识别的模式和原因。我们分析了一个公开的行人-车辆交互数据集,结合对模型定性推理的主题分析与手动视频审查。该双方法方法揭示了影响误识别的 recurring 因素,包括手势可见性、行人行为、交互情境和环境条件。发现表明,手势设计的实用考虑包括显著性和情境冗余的价值,并突显了通过更丰富的情境建模和不确定性感知解释来提高AV识别系统的机会。虽然本研究聚焦于AV-行人交互,但该方法和洞见适用于机器解释人类手势的其他领域,如可穿戴AR和辅助技术。
引用
@article{arxiv.2508.06801,
title = {Understanding Pedestrian Gesture Misrecognition: Insights from Vision-Language Model Reasoning},
author = {Tram Thi Minh Tran and Xinyan Yu and Callum Parker and Julie Stephany Berrio Perez and Stewart Worrall and Martin Tomitsch},
journal= {arXiv preprint arXiv:2508.06801},
year = {2025}
}