报卡:基于自然语言摘要的语言模型定性评估
机器学习
2024-09-04 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)的快速发展和动态特性使得传统的量化基准难以准确评估其能力。我们提出了报卡,这是针对特定技能或主题的模型行为的人类可解释的自然语言摘要。我们发展了一个用于评估报卡的框架,基于三个标准:具体性(区分不同模型的能力)、忠实性(准确代表模型能力)和可解释性(对人类的清晰度和相关性)。我们还提出了一个无需人工监督生成报卡的迭代算法,并探讨了其有效性通过对 various 设计选择的消除实验。通过对流行 LLM 进行实验,我们展示报卡提供了传统基准之外的见解,能够帮助满足对更可解释和全面评估 LLM 的需求。
引用
@article{arxiv.2409.00844,
title = {Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries},
author = {Blair Yang and Fuyang Cui and Keiran Paster and Jimmy Ba and Pashootan Vaezipoor and Silviu Pitis and Michael R. Zhang},
journal= {arXiv preprint arXiv:2409.00844},
year = {2024}
}
备注
11 pages, 8 figures