中文

GPT作为知识工作者:(AI)CPA能力的零样本评估

计算与语言 2023-01-12 v1 人工智能 计算机与社会

摘要

全球经济日益依赖知识工作者来满足公共和私营组织的需求。尽管对知识工作没有单一的定义,组织和行业团体仍试图衡量个人从事知识工作的能力。对专业知识工作者能力准备最全面的评估是由美国注册会计师协会(AICPA)开发的统一CPA考试。在本文中,我们在基于AICPA蓝图的法规(REG)考试样本以及超过200道法律、财务、会计、技术和道德任务多项选择题评估上,对OpenAI的`text-davinci-003`及早期版本GPT进行实验评估。首先,我们发现`text-davinci-003`在REG考试样本章节上正确率为14.4%,在零样本提示的定量推理上显著落后于人类能力。其次,在无需计算的考试中,`text-davinci-003`在记忆与理解以及应用技能层级上似乎接近人类水平表现。在最佳提示与参数下,模型答对57.6%的题目,显著优于25%的猜测率,且其前两个答案正确率达82.1%,表明强非蕴含性。最后,我们发现近期GPT-3代际在此评估上取得实质性改进,从`text-davinci-001`的30%升至`text-davinci-003`的57%。这些发现强烈表明大型语言模型有潜力改变未来知识工作的质量与效率。

关键词

引用

@article{arxiv.2301.04408,
  title  = {GPT as Knowledge Worker: A Zero-Shot Evaluation of (AI)CPA Capabilities},
  author = {Jillian Bommarito and Michael Bommarito and Daniel Martin Katz and Jessica Katz},
  journal= {arXiv preprint arXiv:2301.04408},
  year   = {2023}
}

备注

Source code and data available in online SI at https://github.com/mjbommar/gpt-as-knowledge-worker