ChatGPT 作为研究科学家:探究 GPT 作为研究图书管理员、研究伦理员、数据生成器与数据预测器的能力
人工智能
2024-06-24 v1 计算与语言
计算机与社会
信息检索
机器学习
摘要
ChatGPT 多好?我们系统性地探测了 GPT-3.5 和 GPT-4 在科学过程四个核心组成部分上的能力:作为研究图书管理员、研究伦理员、数据生成器和新颖数据预测器,使用心理科学作为测试场。在研究 1(研究图书管理员)中,GPT-3.5 和 GPT-4 与人类研究员不同,分别以 36.0% 和 5.4% 的比例生成虚构参考文献,尽管 GPT-4 显示出逐渐承认其虚构的能力。在研究 2(研究伦理员)中,GPT-4(但不 GPT-3.5)证明了识别 p-hacking 等违规行为的能力,纠正了 88.6% 的明显问题和 72.6% 的隐含问题。在研究 3(数据生成器)中,两个模型都复制了在大型语言语料库中发现的文化偏见模式,表明 ChatGPT 能够模拟已知结果,这是数据生成和如假设生成等技能的前提。在相反地,在研究 4(新颖数据预测器)中,两个模型都未能成功预测其训练数据中不存在的新结果,两个模型都未显著利用更多新颖信息进行预测。综合来看,这些结果表明 GPT 是一个有缺陷但快速改进的图书管理员,已经是一个不错的研究伦理员,能够在已知特征的简单领域进行数据生成,但在预测实证数据的新模式以助力未来实验方面表现不佳。
引用
@article{arxiv.2406.14765,
title = {ChatGPT as Research Scientist: Probing GPT's Capabilities as a Research Librarian, Research Ethicist, Data Generator and Data Predictor},
author = {Steven A. Lehr and Aylin Caliskan and Suneragiri Liyanage and Mahzarin R. Banaji},
journal= {arXiv preprint arXiv:2406.14765},
year = {2024}
}
备注
Main article is 14 pages, 1 table. Includes SI Appendix: 26 pages, 12 tables, 2 figures. Total: 40 pages, 13 tables, 2 figures. Under revised review at PNAS