中文

PuzzleBench:面向大型多模态模型的全动态拼图解题评估框架

计算机视觉与模式识别 2025-04-16 v1 人工智能

摘要

大型多模态模型(LMM)在广泛的多模态任务中展现出惊人的能力,不断提升在各种评估基准上的性能。然而,现有评估基准通常是静态的,常与预训练数据集重叠,导致固定的复杂性约束和大量数据污染问题。同时,人工标注数据集在耗时、费力且受人类偏见和不一致性影响,导致可靠性和可重复性问题。为此,我们提出一种全动态多模态评估框架,名为Open-ended Visual Puzzle Generation(OVPG),旨在自动生成拼图解题任务中新鲜、多样且可验证的评估数据。具体而言,OVPG管道包括原始材料采样模块、视觉内容生成模块和拼图规则设计模块,确保每个评估实例原始、高度随机且唯一可解,从而实现对LMM不断演进能力的持续适应。基于OVPG,我们构建了PuzzleBench,一个动态且可扩展的基准,包含11,840个VQA样本。它包含六个精心设计的拼图任务,针对三个核心LMM能力:视觉识别、逻辑推理和情境理解。PuzzleBench不同于快速过时的静态基准,能够通过OVPG和丰富的开放性拼图设计实现持续数据集刷新, seamless 适应LMM不断演进的能力。

关键词

引用

@article{arxiv.2504.10885,
  title  = {PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving},
  author = {Zeyu Zhang and Zijian Chen and Zicheng Zhang and Yuze Sun and Yuan Tian and Ziheng Jia and Chunyi Li and Xiaohong Liu and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2504.10885},
  year   = {2025}
}