视觉语言模型中跨语言否定理解的差异性
计算与语言
2026-04-22 v1
摘要
视觉语言模型(VLMs)存在肯定偏差:即便正确描述包含否定(“无X”),模型倾向于选择肯定的描述(“X存在”)。虽然已有工作在英语中记录了这一缺陷并提出了解决方案,但否定在不同语言中通过不同的形态学、词序和附着词化模式呈现,这引发了一个问题:这些解决方案是否对所有语言社区都公平有效。我们引入第一个经人工验证的多语言否定基准,覆盖七种类型多样的语言:英语、中文、阿拉伯语、希腊语、俄语、塔加洛语和西班牙语。评估了三个VLMs——CLIP、SigLIP和MultiCLIP,发现标准CLIP在非拉丁文字语语言中表现低于随机水平,而MultiCLIP取得最高且最一致的准确率。我们还评估了一种提出的否定纠正方法SpaceVLM,发现其对英语、希腊语、西班牙语和塔加洛语等多个语言产生显著改进,但在不同语言的效果呈现差异。这种差异表明,形态学、书写系统和否定结构等语言属性与模型改进在公平性方面的作用存在交互作用。随着VLMs在全球范围内的部署,多语言基准对于理解解决方案是否有效以及针对哪些人群至关重要。
引用
@article{arxiv.2604.18942,
title = {Disparities In Negation Understanding Across Languages In Vision-Language Models},
author = {Charikleia Moraitaki and Sarah Pan and Skyler Pulling and Gwendolyn Flusche and Kumail Alhamoud and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:2604.18942},
year = {2026}
}