InstructEval:指令选择方法的系统性评估
计算与语言
2023-07-18 v2 人工智能
摘要
上下文学习(in-context learning, ICL)通过使用指令和一组称为演示(demonstrations)的少量标注样本提示大语言模型(LLM)来执行任务。近期工作表明,ICL提示中所用输入的精确细节显著影响性能,这促使了指令选择算法的发展。然而,指令选择的影响严重未被充分探索,现有分析局限于模型与任务的浅层子集,限制了其见解的泛化性。我们开发了InstructEval,一个ICL评估套件,以对这些技术进行透彻评估。该套件包含来自四个模型族的13个不同规模的开放权重大语言模型,并覆盖三类共九项任务。利用该套件,我们针对与ICL相关的五项指标评估了七种流行指令选择方法的相对性能。我们的实验揭示,使用精心撰写的手动指令或不带任何任务特定描述的简单指令,通常比自动指令归纳方法引发更优的整体ICL性能,表明后者缺乏泛化能力。我们发布该评估套件,用于基准测试指令选择方法并催生该领域更具泛化性的方法。
引用
@article{arxiv.2307.00259,
title = {InstructEval: Systematic Evaluation of Instruction Selection Methods},
author = {Anirudh Ajith and Chris Pan and Mengzhou Xia and Ameet Deshpande and Karthik Narasimhan},
journal= {arXiv preprint arXiv:2307.00259},
year = {2023}
}
备注
8 content pages + 3 pages of supplementary material, 3 figures, 10 tables