中文

modeLing:用于测试语言模型中语言推理的新数据集

计算与语言 2024-06-26 v1

摘要

我们介绍 modeLing,这是一个新的语言奥林匹克风格谜题基准,用于测试 AI 系统的零样本推理能力。解决这些谜题需要从少量示例中推断语言语法结构的某些方面。这些谜题为语言模型提供了自然的测试基准,因为它们需要组合泛化和零样本归纳推理。modeLing 完全由为本工作专门编写的新谜题组成,确保其不会出现在现有 AI 系统的训练数据中:这消除了许多先前推理评估潜在的“数据泄漏”风险。我们在我们的基准上评估了几个大型开源语言模型和 GPT,观察到相当的准确率,表明存在零样本涌现推理能力,这不能仅仅归因于浅层记忆。然而,模型性能不完美,表明 modeLing 可用于衡量语言推理进一步的进展。

关键词

引用

@article{arxiv.2406.17038,
  title  = {modeLing: A Novel Dataset for Testing Linguistic Reasoning in Language Models},
  author = {Nathan A. Chi and Teodor Malchev and Riley Kong and Ryan A. Chi and Lucas Huang and Ethan A. Chi and R. Thomas McCoy and Dragomir Radev},
  journal= {arXiv preprint arXiv:2406.17038},
  year   = {2024}
}