中文

LMentry:基础语言任务的大语言模型基准

计算与语言 2022-12-20 v2 人工智能 机器学习

摘要

随着大语言模型性能的快速提升,基准也变得越来越大且复杂。我们提出LMentry,一个通过聚焦一组对人类而言微不足道、从而避免此种“军备竞赛”的紧凑任务集的基准,例如写一句含特定词的句子、辨识列表中属于某特定类别的词、或选择两词中较长者。LMentry专为快速且可解释地洞察大语言模型的能力与鲁棒性而设计。我们的实验揭示了多种对人类而言显而易见、却对大语言模型(包括OpenAI最新的175B参数指令微调模型TextDavinci002)构成可观挑战的失败案例。LMentry补充了当代大语言模型评估方法,提供快速、自动且易运行的“单元测试”,而无需诉诸复杂任务的大型基准套件。

关键词

引用

@article{arxiv.2211.02069,
  title  = {LMentry: A Language Model Benchmark of Elementary Language Tasks},
  author = {Avia Efrat and Or Honovich and Omer Levy},
  journal= {arXiv preprint arXiv:2211.02069},
  year   = {2022}
}

备注

minor results updates