LMentry:基础语言任务的大语言模型基准
计算与语言
2022-12-20 v2 人工智能
机器学习
摘要
随着大语言模型性能的快速提升,基准也变得越来越大且复杂。我们提出LMentry,一个通过聚焦一组对人类而言微不足道、从而避免此种“军备竞赛”的紧凑任务集的基准,例如写一句含特定词的句子、辨识列表中属于某特定类别的词、或选择两词中较长者。LMentry专为快速且可解释地洞察大语言模型的能力与鲁棒性而设计。我们的实验揭示了多种对人类而言显而易见、却对大语言模型(包括OpenAI最新的175B参数指令微调模型TextDavinci002)构成可观挑战的失败案例。LMentry补充了当代大语言模型评估方法,提供快速、自动且易运行的“单元测试”,而无需诉诸复杂任务的大型基准套件。
引用
@article{arxiv.2211.02069,
title = {LMentry: A Language Model Benchmark of Elementary Language Tasks},
author = {Avia Efrat and Or Honovich and Omer Levy},
journal= {arXiv preprint arXiv:2211.02069},
year = {2022}
}
备注
minor results updates