FollowEval:评估大语言模型指令遵循能力的多维基准
计算与语言
2023-11-17 v1
摘要
有效评估大语言模型(LLMs)的指令遵循能力至关重要。无法遵循人类指令的模型可能无法提供可靠且有益的回复。为实现此目标,已构建多种基准来评估这些模型的指令遵循能力。然而,这些基准局限于单一语言,且采用自动化方法构建,这限制了其适用性和所包含测试样例的质量。为弥补这一差距,本文引入 FollowEval 基准。该基准由英文和中文实例组成,所有测试样例均由人类专家精心编写。此外,FollowEval 基准旨在从指令遵循的五个关键维度评估 LLMs:字符串操作、常识推理、逻辑推理、空间推理和回复约束。为提升复杂度并提供充分挑战,每个测试样例设计为评估多于一个维度。我们使用 FollowEval 基准评估了多种 LLMs,发现其性能显著落后于人类。这凸显了这些模型在指令遵循能力上尚有相当大的改进空间。
引用
@article{arxiv.2311.09829,
title = {FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models},
author = {Yimin Jing and Renren Jin and Jiahao Hu and Huishi Qiu and Xiaohua Wang and Peng Wang and Deyi Xiong},
journal= {arXiv preprint arXiv:2311.09829},
year = {2023}
}
备注
Work in progress