中文

MultiZebraLogic:一个多语言逻辑推理基准

计算与语言 2025-11-06 v1 人工智能

摘要

衡量大型语言模型(LLM)的全部能力需要代表多个任务的基准测试。我们旨在创建大规模高质量数据集,用于跨多种语言比较逻辑推理技能,适合不同推理能力的 LLM。我们探索了多种增加难度的方法。我们在多语言、多主题、多规模下生成 zebra 拼图,包括 14 种不同线索类型和 8 种红 herring 类型(无信息线索)。我们发现规模为 2x3 和 4x5 的拼图对 GPT-4o mini(非推理模型)和 o3-mini(推理模型)都足够具有挑战性。包括 5 条红 herring 会使 o3-mini 在 4x5 拼图上的水平准确率下降 15±7%。o3-mini 在 4x5 拼图上的得分在英语 vs. 丹麦语或常见住宅主题 vs. 专属丹麦烤肉三文组主题之间没有显著差异。我们发现难度与所选线索类型之间不存在相关性。在九种日耳曼语中分别发布规模为 2x3 和 4x5 的 128+1024 个拼图数据集,作为 MultiZebraLogic。我们发布用于拼图生成的代码,旨在适配更多语言和主题。

关键词

引用

@article{arxiv.2511.03553,
  title  = {MultiZebraLogic: A Multilingual Logical Reasoning Benchmark},
  author = {Sofie Helene Bruun and Dan Saattrup Smart},
  journal= {arXiv preprint arXiv:2511.03553},
  year   = {2025}
}

备注

Submitted to LREC 2026