GPT-3.5、GPT-4 还是 BARD?零样本设定下 LLM 推理能力评估及提示增强性能
计算与语言
2023-09-21 v2 人工智能
摘要
大语言模型(LLMs)已在多种自然语言处理(NLP)任务上展现出卓越性能。然而,关于其推理能力目前存在热议。本文通过对十一个不同数据集上的多种推理任务进行全面技术评估,考察了 GPT-3.5、GPT-4 与 BARD 模型的性能。我们的论文提供了经验证据,展示在几乎所有评估任务中,ChatGPT-4 在零样本设定下相较 ChatGPT-3.5 与 BARD 均具有更优性能。尽管 GPT-4 相对 GPT-3.5 的优越性可归因于其更大规模与 NLP 效率,但 BARD 并未显现此特征。我们还证明这三个模型在归纳推理、数学推理与多跳推理任务上表现有限。为强化发现,我们对这三个模型的结果给出了详尽而全面的分析。此外,我们提出一组工程化提示,提升了三个模型在零样本设定下的性能。
引用
@article{arxiv.2305.12477,
title = {GPT-3.5, GPT-4, or BARD? Evaluating LLMs Reasoning Ability in Zero-Shot Setting and Performance Boosting Through Prompts},
author = {Jessica López Espejel and El Hassane Ettifouri and Mahaman Sanoussi Yahaya Alassan and El Mehdi Chouham and Walid Dahhane},
journal= {arXiv preprint arXiv:2305.12477},
year = {2023}
}
备注
Accepted for publication at Elsevier's Natural Language Processing Journal