中文

面向大语言模型的指令遵循评测

计算与语言 2023-11-15 v1 人工智能 机器学习

摘要

大语言模型(LLMs)的核心能力之一是遵循自然语言指令。然而,此类能力的评测尚未标准化:人工评测昂贵、缓慢且不可客观复现,而基于LLM的自动评测可能存在偏差或受限于评测LLM自身能力。为克服这些问题,我们引入面向大语言模型的指令遵循评测(IFEval)。IFEval是一个直接且易复现的评测基准,聚焦于一组“可验证指令”,如“写多于400词”和“至少提及3次AI关键词”。我们识别出25类此类可验证指令,并构建了约500条提示,每条提示含一个或多个可验证指令。我们给出了市场上两种广泛可用LLM的评测结果。我们的代码与数据见https://github.com/google-research/google-research/tree/master/instruction_following_eval

关键词

引用

@article{arxiv.2311.07911,
  title  = {Instruction-Following Evaluation for Large Language Models},
  author = {Jeffrey Zhou and Tianjian Lu and Swaroop Mishra and Siddhartha Brahma and Sujoy Basu and Yi Luan and Denny Zhou and Le Hou},
  journal= {arXiv preprint arXiv:2311.07911},
  year   = {2023}
}