ChatGPT 在基准数据集上的系统研究与综合评测
计算与语言
2023-07-07 v4 人工智能
机器学习
摘要
诸如 ChatGPT 之类的大语言模型(LLMs)的发展近期备受关注。然而,由于难以将该模型生成的生成式输出与真实标签比对,其在学术基准数据集上的评测仍待探索。本文旨在对 ChatGPT 在多样学术数据集上的表现进行全面评测,涵盖问答、文本摘要、代码生成、常识推理、数学解题、机器翻译、偏见检测与伦理考量等任务。具体而言,我们在 140 个任务上评估 ChatGPT,并分析其在这些数据集中生成的 255K 条响应。这使我们的工作成为 NLP 基准中规模最大的 ChatGPT 评测。简言之,本研究旨在验证 ChatGPT 在各任务中的优势与不足,并为未来使用 LLMs 的研究提供见解。我们还报告了一种主要发现于 ChatGPT 及其他指令微调模型中的遵循多查询指令的新涌现能力。我们广泛的评测表明,尽管 ChatGPT 能执行多种任务,并在若干基准数据集中取得令人印象深刻的性能,但其距离可靠解决众多挑战性任务的能力仍相去甚远。通过对 ChatGPT 跨多样 NLP 任务性能的透彻评估,本文为 ChatGPT 类 LLMs 在真实应用中的针对性部署奠定了基础。
引用
@article{arxiv.2305.18486,
title = {A Systematic Study and Comprehensive Evaluation of ChatGPT on Benchmark Datasets},
author = {Md Tahmid Rahman Laskar and M Saiful Bari and Mizanur Rahman and Md Amran Hossen Bhuiyan and Shafiq Joty and Jimmy Xiangji Huang},
journal= {arXiv preprint arXiv:2305.18486},
year = {2023}
}
备注
Accepted by ACL 2023 Findings. The first three authors contributed equally