中文

CrossWordBench:通过可控拼图生成评估 LLMs 和 LVLMs 的推理能力

计算与语言 2025-08-13 v2 人工智能 计算机视觉与模式识别

摘要

现有的 LLMs(Large Language Models)和 LVLMs(Large Vision-Language Models)推理评估框架主要评估文本推理或视觉语言理解能力,二者之间的动态互动有限。为此,我们引入 CrossWordBench,通过交叉字谜这种需要模型遵循文本线索的语义约束以及视觉网格结构的交叉约束来评估 LLMs 和 LVLMs 的推理能力。CrossWordBench 利用可控拼图生成框架,可产生两种格式(文本和图像)的拼图,通过预填充比率控制难度,并提供从直接拼图求解到交互式模式的不同评估策略。我们对超过 20 个模型进行了广泛评估,结果显示,具备推理能力的 LLMs 通过有效利用交叉字母约束显著优于非推理模型。我们进一步演示了 LVLMs 在该任务上表现不佳,显示出其拼图解决性能与网格解析准确率之间存在强烈相关性。我们的发现凸显了当前 LLMs 和 LVLMs 推理能力的局限,并为未来评估提供了有效的多模态受限任务创建方法。

关键词

引用

@article{arxiv.2504.00043,
  title  = {CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation},
  author = {Jixuan Leng and Chengsong Huang and Langlin Huang and Bill Yuchen Lin and William W. Cohen and Haohan Wang and Jiaxin Huang},
  journal= {arXiv preprint arXiv:2504.00043},
  year   = {2025}
}