中文

LINGOLY:低资源与濒危语言中奥林匹克级语言推理谜题基准

计算与语言 2024-11-01 v3

摘要

本文提出了 LingOly 基准,这是一个用于评估大型语言模型高级推理能力的新型基准。我们利用具有挑战性的语言奥林匹克谜题,评估 (i) 在极低资源或濒危语言中识别和概括语言模式的能力,以及 (ii) 遵循复杂任务指令的能力。LingOly 基准涵盖超过 90 种主要为低资源语言的语言,最大程度减少数据污染问题,包含 1,133 题,覆盖 6 种格式和 5 级人类难度。我们采用直接准确率以及与无上下文基准的比较来评估性能,以惩罚记忆。来自 11 个最先进大型语言模型的得分表明,该基准具有挑战性,模型在高难度问题上表现不佳。即使是最好的模型,也仅达到 38.7% 的准确率,比无上下文基准高出 24.7%。大型封闭模型通常优于开放模型,且语言资源越高,得分越好。这些结果表明,在无记忆的情况下,当前语言模型在真正的多步骤跨域推理方面仍面临挑战。

关键词

引用

@article{arxiv.2406.06196,
  title  = {LINGOLY: A Benchmark of Olympiad-Level Linguistic Reasoning Puzzles in Low-Resource and Extinct Languages},
  author = {Andrew M. Bean and Simi Hellsten and Harry Mayne and Jabez Magomere and Ethan A. Chi and Ryan Chi and Scott A. Hale and Hannah Rose Kirk},
  journal= {arXiv preprint arXiv:2406.06196},
  year   = {2024}
}

备注

Oral presentation at NeurIPS 2024 Datasets and Benchmarks Track. 10 pages, 5 figures, 22 pages supplemental materials