专业认证基准数据集:面向大语言模型的首个500种职业测试
人工智能
2023-05-10 v1 机器学习
摘要
本研究创建了一项专业认证测评,用于测试大语言模型并评估其可就业技能。它比较了 GPT-3 与 Turbo-GPT3.5 两个 AI 模型在包含 1149 项专业认证的基准数据集上的表现,强调职业准备能力而非学业成绩。GPT-3 在未进行微调或考试准备的情况下,在 39% 的专业认证中取得了及格分数(正确率 >70%)。这些模型在计算机相关多个领域展现出资质,如云与虚拟化、业务分析、网络安全、网络搭建与维修以及数据分析。Turbo-GPT3.5 在极具价值的进攻性安全认证专家(OSCP)考试中取得了 100% 的分数。这些模型还在其他专业领域表现出能力,包括护理、持证咨询、药学与教学。Turbo-GPT3.5 在未准备的情况下以 70% 的成绩通过了美国金融业监管局(FINRA)Series 6 考试。有趣的是,Turbo-GPT3.5 在客户服务任务上表现良好,暗示了在呼叫中心聊天机器人与常规咨询服务等人类增强方面的潜在应用。这些模型在基于感官与体验的测试(如葡萄酒侍酒师、啤酒品鉴师、情商与肢体语言解读)上也得分良好。OpenAI 模型从 Babbage 到 Turbo 的改进在不到几年内带来了中位数 60% 的更优成绩表现。这一进展表明,聚焦最新模型的短板可催生出能够掌握最严苛专业认证的高性能 AI。我们开源了该基准,以随着模型改进或涌现新能力而扩展可测试专业技能的范围。
引用
@article{arxiv.2305.05377,
title = {Professional Certification Benchmark Dataset: The First 500 Jobs For Large Language Models},
author = {David Noever and Matt Ciolino},
journal= {arXiv preprint arXiv:2305.05377},
year = {2023}
}