GPT-3 与 GPT-3.5 系列模型的综合能力分析
计算与语言
2023-12-27 v2
摘要
GPT 系列模型,如 GPT-3、CodeX、InstructGPT、ChatGPT 等,因其卓越的自然语言处理能力而备受关注。然而,尽管关于 GPT 系列模型与微调模型之间能力差异的研究众多,针对 GPT 系列模型能力随时间演进的关注却十分有限。为对 GPT 系列模型的能力进行全面分析,我们选取了六个代表性模型,包括两个 GPT-3 系列模型(即 davinci 与 text-davinci-001)和四个 GPT-3.5 系列模型(即 code-davinci-002、text-davinci-002、text-davinci-003 与 gpt-3.5-turbo)。我们使用 21 个数据集在九项自然语言理解(NLU)任务上评估了它们的性能。特别地,我们在零样本与少样本场景下比较了各模型在每项任务上的性能与鲁棒性。我们大量的实验表明,GPT 系列模型在 NLU 任务上的整体能力并非随模型演进逐步提升,尤其是在引入 RLHF 训练策略之后。尽管该策略增强了模型生成类人回复的能力,却也损害了它们解决某些任务的能力。此外,我们的结果表明,在模型鲁棒性等方向仍有改进空间。
引用
@article{arxiv.2303.10420,
title = {A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models},
author = {Junjie Ye and Xuanting Chen and Nuo Xu and Can Zu and Zekai Shao and Shichun Liu and Yuhan Cui and Zeyang Zhou and Chao Gong and Yang Shen and Jie Zhou and Siming Chen and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2303.10420},
year = {2023}
}