F-Eval:使用精细化评估方法评估基础能力
计算与语言
2024-08-21 v2
摘要
大语言模型 (LLMs) 因其前所未有的性能而备受关注,导致评估 LLMs 的研究越来越多。然而,这些评估基准仅限于评估指令遵循能力,忽视了预训练阶段涌现的基础能力。先前的主观评估方法主要依赖 API 模型评分。然而,在缺乏参考的情况下,大模型显示出辨别细微差异的能力有限。为弥补这一差距,我们提出了 F-Eval,一个用于评估基础能力(包括表达、常识和逻辑)的双语评估基准。F-Eval 中的任务包括多选客观任务、开放式客观任务、基于参考的主观任务和无参考主观任务。对于无参考主观任务,我们设计了新的评估方法,作为 API 模型评分的替代方案。我们对 13 个先进的 LLMs 进行了评估。结果表明,我们的评估方法相比其他评估器显示出更高的相关系数和更大的区分度。此外,我们讨论了不同模型大小、维度和归一化方法的影响。我们期望 F-Eval 将促进对 LLMs 基础能力的研究。
引用
@article{arxiv.2401.14869,
title = {F-Eval: Assessing Fundamental Abilities with Refined Evaluation Methods},
author = {Yu Sun and Keyu Chen and Shujie Wang and Peiji Li and Qipeng Guo and Hang Yan and Xipeng Qiu and Xuanjing Huang and Dahua Lin},
journal= {arXiv preprint arXiv:2401.14869},
year = {2024}
}
备注
ACL 2024