基于核心能力的视角:大语言模型评测综述
计算与语言
2023-08-16 v1 人工智能
摘要
从预训练语言模型(PLM)到大语言模型(LLM),自然语言处理(NLP)领域经历了性能的快速提升与广泛的实际应用。对一个研究领域的评测指引着其改进方向。然而,LLM极难被全面评测,原因有二:首先,由于LLM的优异表现,传统NLP任务已显不足;其次,现有评测任务难以跟上现实场景中广泛的应用范围。为应对这些问题,已有工作提出了各种基准以更好地评测LLM。为厘清学术界与工业界中繁多的评测任务,我们调研了多篇关于LLM评测的论文。我们总结了LLM的4项核心能力,包括推理、知识、可靠性和安全性。针对每项能力,我们介绍其定义、相应基准与指标。在此能力架构下,相似任务被归并以反映相应能力,同时新任务也可便捷地加入该体系。最后,我们就LLM评测的未来方向给出建议。
引用
@article{arxiv.2308.07902,
title = {Through the Lens of Core Competency: Survey on Evaluation of Large Language Models},
author = {Ziyu Zhuang and Qiguang Chen and Longxuan Ma and Mingda Li and Yi Han and Yushan Qian and Haopeng Bai and Zixian Feng and Weinan Zhang and Ting Liu},
journal= {arXiv preprint arXiv:2308.07902},
year = {2023}
}