中文

实用大语言模型评估综述

计算与语言 2024-06-04 v1

摘要

大语言模型(LLM)因其在广泛复杂任务上的卓越表现而受到各个研究领域的关注。因此,需要精细的方法来评估LLM的能力,以确定它们应承担的任务和责任。我们的研究主要讨论了如何有效评估作为实用工具的LLM。我们提出了一个两阶段框架:从“核心能力”到“智能体”,清晰解释了如何基于LLM的具体能力来应用它们,以及每个阶段的评估方法。核心能力是指LLM生成高质量自然语言文本所需的能力。在确认LLM具备核心能力后,它们可以作为智能体解决现实世界中的复杂任务。在“核心能力”阶段,我们讨论了LLM的推理能力、社会影响和领域知识。在“智能体”阶段,我们展示了LLM智能体应用中的具身行动、规划和工具学习。最后,我们审视了当前LLM评估方法面临的挑战以及未来的发展方向。

关键词

引用

@article{arxiv.2406.00936,
  title  = {A Survey of Useful LLM Evaluation},
  author = {Ji-Lun Peng and Sijia Cheng and Egil Diau and Yung-Yu Shih and Po-Heng Chen and Yen-Ting Lin and Yun-Nung Chen},
  journal= {arXiv preprint arXiv:2406.00936},
  year   = {2024}
}