中文

Eye-Q:面向视觉字谜求解与图像到表述推理的多语言基准

计算机视觉与模式识别 2026-01-08 v1 人工智能

摘要

视觉语言模型(VLMs)在标准视觉语言基准测试中取得了强大的性能,但往往依赖于表层识别而非更深入的推理。我们提出视觉字谜作为一种具有挑战性的替代方案,因为它们需要发现隐含的视觉线索、生成和修订假设,并将感知证据映射到非文字概念,这些都难以通过字面 grounding、OCR 依赖或简单检索式匹配来解决。我们引入Eye-Q,一个旨在评估这种复杂视觉理解形式的多语言基准。Eye-Q包含1343个字谜,模型需在概念密集的场景中观察简短描述,并推断出特定目标词或短语。这些字谜本构意外且线索隐含,包含干扰项和上下文关系,要求选择性注意、抽象和联想推理。基准涵盖英语、波斯语、阿拉伯语以及跨语言字谜。我们使用开放式、人类对齐的协议评估最先进的VLMs,该协议探测假设形成和修订在轻度帮助下的表现。结果显示在抽象和跨语言字谜上的显著性能差距,凸显了当前模型在构建和搜索适当概念表示以实现灵活图像到表述推理方面的局限性;最高准确率仅为60.27%。

关键词

引用

@article{arxiv.2601.03400,
  title  = {Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning},
  author = {Ali Najar and Alireza Mirrokni and Arshia Izadyari and Sadegh Mohammadian and Amir Homayoon Sharifizade and Asal Meskin and Mobin Bagherian and Ehsaneddin Asgari},
  journal= {arXiv preprint arXiv:2601.03400},
  year   = {2026}
}

备注

8 pages