视觉形象性挑战:评估视觉-语言模型在手语形式-意义映射上的表现
计算机视觉与模式识别
2026-05-21 v3 计算与语言
摘要
形象性(iconicity)指语言形式与意义之间的相似性,在手语中广泛存在,为视觉 grounding 提供了自然的测试基准。对于视觉-语言模型(VLM),挑战在于从动态人类运动中恢复此类关键映射。我们引入视觉形象性挑战(Visual Iconicity Challenge),一个新颖的基于视频的数据集,将心理语言学度量标准适用于 VLM 评估三个任务:(i)语音形式预测(如手势、位置),(ii)透明度(从视觉形式推断意义),(iii)分级形象性评级。我们评估了 13 个最新的 VLM 在零样本和少量样本设置下在荷兰手语数据集上的表现,并与人类基准进行比较。在语音形式预测方面,VLM 能恢复部分手势和位置细节,但仍低于人类水平;在透明度方面,距离人类基准仍有较大差距;仅有顶级模型与人类形象性评级呈中等相关性。有趣的是,预测能力更强的模型在人类形象性判断方面的相关性也更高,表明其对视觉 grounding 结构具有相似的敏感性。我们的发现验证了这些诊断性任务的有效性,激励人类中心信号和具身学习方法用于建模形象性并提高多模态模型的视觉 grounding 能力。
引用
@article{arxiv.2510.08482,
title = {The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping},
author = {Onur Keleş and Aslı Özyürek and Gerardo Ortega and Kadir Gökgöz and Esam Ghaleb},
journal= {arXiv preprint arXiv:2510.08482},
year = {2026}
}