视觉语言模型误将头部姿态推断为注视方向:非语言对话线索
计算机视觉与模式识别
2026-05-01 v3 计算与语言
摘要
某个对象看向的方向是非语言交际线索,儿童和成年人都能轻易辨识。视觉语言模型(Vision-Language Models, VLMs)多好的推断注视目标?为构建评估 stimuli,我们拍摄了1360幅真实场景照片,其中人物注视桌上某几个对象之一。重要的是,我们控制了注视者的头部姿态:有时指向注视目标,有时指向干扰物,还有时则不受约束。我们发现VLMs与人类之间存在显著性能差距,排除了分辨率和对象命名能力等备选解释,确定差距主因是VLMs通过头部姿态而非面部表情来推断注视方向。这种偏差可能源于数据而非模型结构,基于Transformer架构视觉模型的原型实验支持了这一结论。未来工作应探究这些发现是否广泛适用于各种深度学习方法,这些方法在现有数据上训练,以及更好的数据是否能缓解此问题。确定原因为具备更高效的人机交互能力的技术铺平了道路,这些技术能够解释注视目标。
引用
@article{arxiv.2506.05412,
title = {Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues},
author = {Zory Zhang and Pinyuan Feng and Bingyang Wang and Tianwei Zhao and Suyang Yu and Qingying Gao and Hokin Deng and Ziqiao Ma and Yijiang Li and Dezhi Luo},
journal= {arXiv preprint arXiv:2506.05412},
year = {2026}
}
备注
Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/