中文

REBUS:一个稳健的符号理解评估基准

计算与语言 2024-06-05 v2 人工智能 计算机视觉与模式识别 计算机与社会

摘要

我们提出一个新的基准,用于评估多模态大语言模型在画谜(rebus puzzles)上的表现。该数据集包含 333 个基于图像的原创文字游戏示例,涉及电影、作曲家、主要城市和食物等 13 个类别。要在识别所暗示的单词或短语这一基准上取得良好表现,模型必须将图像识别和字符串操作与假设检验、多步推理以及对人类认知的理解相结合,从而构成一项复杂、多模态的能力评估。我们发现 GPT-4o 显著优于所有其他模型,其次是闭源模型优于所有其他被评估模型。然而,即便是最好的模型,其最终准确率也仅为 42%,在困难谜题上更是降至仅 7%,这凸显了在推理方面进行实质性改进的必要性。此外,模型很少能理解谜题的所有部分,并且几乎总是无法回溯性地解释正确答案。因此,我们的基准可用于识别多模态大语言模型在知识和推理方面的主要缺陷。

关键词

引用

@article{arxiv.2401.05604,
  title  = {REBUS: A Robust Evaluation Benchmark of Understanding Symbols},
  author = {Andrew Gritsevskiy and Arjun Panickssery and Aaron Kirtland and Derik Kauffman and Hans Gundlach and Irina Gritsevskaya and Joe Cavanagh and Jonathan Chiang and Lydia La Roux and Michelle Hung},
  journal= {arXiv preprint arXiv:2401.05604},
  year   = {2024}
}

备注

20 pages, 5 figures. For code, see http://github.com/cvndsh/rebus