NLPBench:评估大语言模型解决NLP问题的能力
计算与语言
2023-10-20 v4
摘要
大语言模型(LLMs)的近期进展显示出增强自然语言处理(NLP)能力的潜力。尽管取得这些成功,专门针对LLM解决NLP问题能力的研究仍然匮乏。为填补该领域空白,我们提出一个独特的基准数据集 NLPBench,包含378道大学水平NLP题目,题目涵盖各类NLP主题,来源于耶鲁大学以往的期末考试。NLPBench包含带上下文的题目,其中多个子问题共享同一公共信息,以及多样题型,包括选择题、简答题与数学题。我们以 GPT-3.5/4、PaLM-2 和 LLAMA-2 等LLM为核心进行评估,并引入思维链(CoT)与思维树(ToT)等先进提示策略。我们的研究表明,先进提示策略的有效性可能不稳定,偶尔会损害LLM性能,尤其在 LLAMA-2(13b)等较小模型中。此外,我们的人工评估揭示了LLM科学问题解决技能的具体缺陷,其中逻辑分解与推理的弱点显著影响了结果。
引用
@article{arxiv.2309.15630,
title = {NLPBench: Evaluating Large Language Models on Solving NLP Problems},
author = {Linxin Song and Jieyu Zhang and Lechao Cheng and Pengyuan Zhou and Tianyi Zhou and Irene Li},
journal= {arXiv preprint arXiv:2309.15630},
year = {2023}
}