视觉语言模型能否理解肢体表演动作?
计算与语言
2025-08-08 v2 人工智能
计算机视觉与模式识别
摘要
非语言交流(NVC)在人类语言中发挥着关键作用,但由于其范围广泛且在不同个体和文化间解释方差极大,研究NVC本身具有挑战性。然而,肢体表演——即仅使用肢体、表情和动作暗示意图的戏剧技巧——是NVC的一个子集,包含明确且具象的动作,人类解释方差较低。我们认为,掌握对肢体表演动作的理解是视觉语言模型能够解释和指挥更细微NVC方面的关键前提。因此,我们提出了Mime Identification Multimodal Evaluation(MIME),一个新颖的基于视频的问答基准测试,包含86种肢体表演动作。MIME基于运动捕捉数据构建,包含对每个动作进行的变体,施加角色、背景和视角的扰动,以评估识别鲁棒性。我们发现,无论是开源模型还是API-based视觉语言模型,都在MIME上显著低于人类水平,这激励了增加研究以在视觉语言模型中植入更健壮的人类肢体动作理解能力。
引用
@article{arxiv.2506.21586,
title = {Can Vision Language Models Understand Mimed Actions?},
author = {Hyundong Cho and Spencer Lin and Tejas Srinivasan and Michael Saxon and Deuksin Kwon and Natali T. Chavez and Jonathan May},
journal= {arXiv preprint arXiv:2506.21586},
year = {2025}
}
备注
ACL 2025 Findings