中文

通过专业测试评估 AI 职业技能

机器学习 2023-12-19 v1 人工智能

摘要

使用一项新颖的专业认证调查,本研究侧重于评估两个被广泛引用的 AI 模型 GPT-3 和 Turbo-GPT3.5 的职业技能。该方法通过考察模型在包含 1149 项专业认证的基准数据集上的表现,强调了实践准备度而非学术表现的重要性。本研究还包括与人类测试分数的比较,提供了关于 AI 模型在专业认证中匹配甚至超越人类表现的潜力的视角。GPT-3 即使在没有任何微调或备考的情况下,也在 39% 的专业认证中达到了及格分数(正确率超过 70%)。它展示了在计算机相关领域的熟练度,包括云和虚拟化、商业分析、网络安全、网络设置与维修以及数据分析。另一方面,Turbo-GPT3.5 在备受推崇的 Offensive Security Certified Professional (OSCP) 考试中获得了 100% 的满分。该模型还在护理、持证咨询、药学和航空等不同的专业领域展示了能力。Turbo-GPT3.5 在客户服务任务中表现出色,表明在增强呼叫中心聊天机器人和日常建议服务方面具有潜在用例。这两个模型在机器传统角色之外的感觉和基于经验的测试中也取得了良好的成绩,包括品酒师、啤酒品鉴、情商和肢体语言解读。研究发现,OpenAI 的模型从 Babbage 到 Turbo 的改进在几年内使评分标准上的性能提高了 60%。这一进展表明,解决当前模型的局限性可能会产生一种能够通过即使是最严格的专业认证的 AI。

关键词

引用

@article{arxiv.2312.10603,
  title  = {Evaluating AI Vocational Skills Through Professional Testing},
  author = {David Noever and Matt Ciolino},
  journal= {arXiv preprint arXiv:2312.10603},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2305.05377