中文

德国事实数据上的视觉语言模型基准测试

计算与语言 2025-06-30 v2

摘要

与 LLM 类似,视觉语言模型的开发主要依赖英语数据集和在英语、中文语言环境中训练的模型,而对其他语言的支持——即使是被认为是高资源语言的德语——也显著不足。本文present对开源 VLMs 在德语和英语语言中的事实知识进行分析。我们通过在两种提示语言和来自德国及国际背景的图像中分别分析准确率,来 disentangle 图像相关因素与文本因素。我们发现对于明星和景点,VLMs 因缺乏对德语图像内容的视觉认知而难以正确识别。对于动物和植物,所测试的模型通常可以根据科学名称或英语常用名称正确识别图像内容,但在德语语言环境中会失败。汽车和超市产品在英语和德语图像中在两种提示语言下都能被准确识别。

关键词

引用

@article{arxiv.2504.11108,
  title  = {Benchmarking Vision Language Models on German Factual Data},
  author = {René Peinl and Vincent Tischler},
  journal= {arXiv preprint arXiv:2504.11108},
  year   = {2025}
}

备注

Peinl, Ren\'e; Tischler, Vincent (2025): Benchmarking Vision Language Models on German Factual Data. 21st International Conference on Artificial Intelligence Applications and Innovations, 26-29 June, 2025, Limassol, Cyprus (accepted)