中文

语言模型可重复评估的实战经验教训

计算与语言 2024-05-30 v2

摘要

语言模型的有效评估仍然是自然语言处理中的一个开放挑战。研究人员和工程师面临方法论问题,例如模型对评估设置的敏感性、跨方法进行适当比较的困难,以及缺乏可重复性和透明度。在本文中,我们借鉴三年来评估大型语言模型的经验,为研究人员提供指导和教训。首先,我们概述了语言模型评估中常见的挑战。其次,我们描述了解决或减轻这些挑战对研究影响的最佳实践。第三,我们介绍了语言模型评估工具(lm-eval):一个用于独立、可重复和可扩展的语言模型评估的开源库,旨在解决这些问题。我们描述了该库的特性以及该库被用于缓解这些方法论问题的案例研究。

关键词

引用

@article{arxiv.2405.14782,
  title  = {Lessons from the Trenches on Reproducible Evaluation of Language Models},
  author = {Stella Biderman and Hailey Schoelkopf and Lintang Sutawika and Leo Gao and Jonathan Tow and Baber Abbasi and Alham Fikri Aji and Pawan Sasanka Ammanamanchi and Sidney Black and Jordan Clive and Anthony DiPofi and Julen Etxaniz and Benjamin Fattori and Jessica Zosa Forde and Charles Foster and Jeffrey Hsu and Mimansa Jaiswal and Wilson Y. Lee and Haonan Li and Charles Lovering and Niklas Muennighoff and Ellie Pavlick and Jason Phang and Aviya Skowron and Samson Tan and Xiangru Tang and Kevin A. Wang and Genta Indra Winata and François Yvon and Andy Zou},
  journal= {arXiv preprint arXiv:2405.14782},
  year   = {2024}
}