中文

$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: 一个大型且多样化的多模态基准,用于评估视觉语言模型理解迷阵拼图的能力

计算机视觉与模式识别 2025-11-04 v1 计算与语言

摘要

理解迷阵拼图(迷阵拼图使用图片、符号和字母以创造性方式代表单词或短语)需要多种技能,如图像识别、认知技能、常识推理、多步骤推理、基于图像的文字游戏等,这对当前的视觉语言模型来说是一个具有挑战性的任务。本文提出了 BUS\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|,这是一个包含 1,333 个英文迷阵拼图的大型且多样化的基准,涵盖不同的艺术风格和难度水平,分布在食物、习语、体育、金融、娱乐等 18 个类别。我们还提出了 RebusDescProgICERebusDescProgICE,一个模型中性的框架,该框架结合了非结构化描述和基于代码的结构化推理,以及更好的基于推理的情境示例选择,使使用闭源和开源模型在 BUS\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right| 上的性能分别提高了 2.14.1%2.1-4.1\%2030%20-30\%,显著优于链式思考推理方法。

关键词

引用

@article{arxiv.2511.01340,
  title  = {$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles},
  author = {Trishanu Das and Abhilash Nandy and Khush Bajaj and Deepiha S},
  journal= {arXiv preprint arXiv:2511.01340},
  year   = {2025}
}

备注

7 pages, 5 figures, 4 tables