语言模型的整体评估
摘要
语言模型(LMs)正成为几乎所有主要语言技术的基础,但其能力、局限性和风险尚未被充分理解。我们提出语言模型整体评估(HELM)以提升语言模型的透明度。首先,我们对语言模型感兴趣的庞大潜在场景(即用例)和指标(即期望属性)空间进行分类。然后我们基于覆盖度和可行性选择一个广泛的子集,并指出缺失或代表性不足的部分(例如被忽视的英语方言的问答、可信度指标)。其次,我们采用多指标方法:在 16 个核心场景中,尽可能对每个场景测量 7 个指标(准确性、校准、鲁棒性、公平性、偏见、毒性和效率)(占 87.5% 的时间)。这确保了准确性之外的指标不会被忽视,并且权衡被清晰暴露。我们还基于 26 个针对性场景进行了 7 项针对性评估,以分析特定方面(例如推理、虚假信息)。第三,我们在所有 42 个场景上对 30 个著名语言模型(涵盖开放、受限访问和封闭模型)进行了大规模评估,其中 21 个场景此前未用于主流 LM 评估。在 HELM 之前,模型平均仅在 17.9% 的核心 HELM 场景上被评估,一些著名模型甚至没有共享任何一个共同场景。我们将其提升至 96.0%:现在所有 30 个模型都在标准化条件下对相同的核心场景和指标进行了密集基准测试。我们的评估揭示了 25 项顶层发现。为完全透明,我们公开发布所有原始模型提示和补全以供进一步分析,以及一个通用的模块化工具包。我们期望 HELM 成为社区的一个持续更新的活基准,不断加入新场景、指标和模型。
引用
@article{arxiv.2211.09110,
title = {Holistic Evaluation of Language Models},
author = {Percy Liang and Rishi Bommasani and Tony Lee and Dimitris Tsipras and Dilara Soylu and Michihiro Yasunaga and Yian Zhang and Deepak Narayanan and Yuhuai Wu and Ananya Kumar and Benjamin Newman and Binhang Yuan and Bobby Yan and Ce Zhang and Christian Cosgrove and Christopher D. Manning and Christopher Ré and Diana Acosta-Navas and Drew A. Hudson and Eric Zelikman and Esin Durmus and Faisal Ladhak and Frieda Rong and Hongyu Ren and Huaxiu Yao and Jue Wang and Keshav Santhanam and Laurel Orr and Lucia Zheng and Mert Yuksekgonul and Mirac Suzgun and Nathan Kim and Neel Guha and Niladri Chatterji and Omar Khattab and Peter Henderson and Qian Huang and Ryan Chi and Sang Michael Xie and Shibani Santurkar and Surya Ganguli and Tatsunori Hashimoto and Thomas Icard and Tianyi Zhang and Vishrav Chaudhary and William Wang and Xuechen Li and Yifan Mai and Yuhui Zhang and Yuta Koreeda},
journal= {arXiv preprint arXiv:2211.09110},
year = {2023}
}
备注
Authored by the Center for Research on Foundation Models (CRFM) at the Stanford Institute for Human-Centered Artificial Intelligence (HAI). Project page: https://crfm.stanford.edu/helm/v1.0