中文

自动化数据集更新:面向可靠和及时评估大型语言模型

计算与语言 2024-06-07 v3

摘要

大型语言模型(LLM)在 various natural language benchmarks 上取得了惊人的性能,促使不断需要 curate 更具挑战性的数据集以适应更大的 LLM,这既成本高昂又耗时。本文提出自动化数据集更新方法,并对其在处理基准泄漏问题、难度控制和稳定性方面的有效性进行系统性分析。因此,一旦当前基准被掌握或泄漏,我们即可进行及时可靠的评估。存在两种更新策略:1)模仿策略通过保留原有数据风格和语境本质来生成类似样本,以及2)扩展策略通过适应教育目标的布卢姆分类法在不同认知水平上扩展现有样本。对更新后的 MMLU 和 BIG-Bench 进行大量实验,证明了所提策略的稳定性,并发现模仿策略能有效缓解基准泄漏导致的过度估计问题。在高效模仿策略失败的情况下,我们的扩展策略仍显示出有前景的效果。此外,通过控制难度,我们能够更好地区分模型性能,实现对既不过于艰巨也不过于简单的考试进行细粒度分析。就可靠和及时评估而言,我们是首次实现自动化基准更新。我们的演示排行榜可在 https://yingjiahao14.github.io/Automating-DatasetUpdates/ 查看。

关键词

引用

@article{arxiv.2402.11894,
  title  = {Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models},
  author = {Jiahao Ying and Yixin Cao and Yushi Bai and Qianru Sun and Bo Wang and Wei Tang and Zhaojun Ding and Yizhe Yang and Xuanjing Huang and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2402.11894},
  year   = {2024}
}