$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: 一个大型且多样化的多模态基准,用于评估视觉语言模型理解迷阵拼图的能力
计算机视觉与模式识别
2025-11-04 v1 计算与语言
摘要
理解迷阵拼图(迷阵拼图使用图片、符号和字母以创造性方式代表单词或短语)需要多种技能,如图像识别、认知技能、常识推理、多步骤推理、基于图像的文字游戏等,这对当前的视觉语言模型来说是一个具有挑战性的任务。本文提出了 ,这是一个包含 1,333 个英文迷阵拼图的大型且多样化的基准,涵盖不同的艺术风格和难度水平,分布在食物、习语、体育、金融、娱乐等 18 个类别。我们还提出了 ,一个模型中性的框架,该框架结合了非结构化描述和基于代码的结构化推理,以及更好的基于推理的情境示例选择,使使用闭源和开源模型在 上的性能分别提高了 和 ,显著优于链式思考推理方法。
引用
@article{arxiv.2511.01340,
title = {$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles},
author = {Trishanu Das and Abhilash Nandy and Khush Bajaj and Deepiha S},
journal= {arXiv preprint arXiv:2511.01340},
year = {2025}
}
备注
7 pages, 5 figures, 4 tables