中文

S3Eval:面向大语言模型的合成、可扩展、系统化评测套件

计算与语言 2024-04-09 v2

摘要

大语言模型(LLMs)的快速发展带来了模型在长上下文理解与推理等能力上的巨大进步。然而,随着 LLM 可处理更长上下文,评估其是否习得特定能力变得更具挑战,因为它们可处理的文本长度(如 200K tokens)远超人类在合理时间内可靠评估的范围。本文提出使用复杂合成任务作为代理评测方法,并呈现 S3Eval,一个面向 LLM 评测的合成、可扩展、系统化评测套件。S3Eval 的合成特性使用户对数据集拥有完全控制,可通过扩展文本长度及在多样场景中调节任务难度,系统化探查 LLM 能力。S3Eval 与真实世界基准的强相关性证明了以其评测 LLM 的合理性。S3Eval 提供灵活且无限的长上下文数据生成方法。我们已生成名为 S3Eval-Standard 的综合数据集,实验结果表明其对所有现有 LLM 均构成显著挑战。

关键词

引用

@article{arxiv.2310.15147,
  title  = {S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models},
  author = {Fangyu Lei and Qian Liu and Yiming Huang and Shizhu He and Jun Zhao and Kang Liu},
  journal= {arXiv preprint arXiv:2310.15147},
  year   = {2024}
}

备注

NAACL 2024