中文

超越基准测试:大语言模型评估与评价的新范式

计算与语言 2024-07-11 v1

摘要

在当前用于评估大语言模型(LLM)的基准测试中,存在评估内容受限、更新不及时以及缺乏优化指导等问题。在本文中,我们提出了一种用于衡量 LLM 的新范式:基准测试-评估-评价。我们的范式将 LLM 评估的“地点”从“考场”转移到了“医院”。通过对 LLM 进行“体检”,该范式将特定的任务求解作为评估内容,对 LLM 内部存在的问题进行深度归因,并提供优化建议。

关键词

引用

@article{arxiv.2407.07531,
  title  = {Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models},
  author = {Jin Liu and Qingquan Li and Wenlong Du},
  journal= {arXiv preprint arXiv:2407.07531},
  year   = {2024}
}