DataAgent:评估大型语言模型回答零样本自然语言查询的能力
计算与语言
2024-04-02 v1 人工智能
摘要
分析数据集和提取有意义信息的传统过程通常耗时且费力。先前的工作已将手动、重复的编码和数据收集确定为阻碍数据科学家从事更细致工作和高级项目的主要障碍。为了解决这个问题,我们评估了OpenAI的GPT-3.5作为“语言数据科学家”(LDS),它可以从给定数据集中推断出关键发现,包括相关性和基本信息。该模型在一组多样化的基准数据集上进行了测试,以评估其在多个标准上的性能,包括涉及NumPy、Pandas、Scikit-Learn和TensorFlow等库的数据科学代码生成任务,并且在正确回答与基准数据集相关的给定数据科学查询方面取得了广泛成功。LDS使用了多种新颖的提示工程技术来有效回答问题,包括思维链强化和SayCan提示工程。我们的研究结果表明,利用大型语言模型进行低层次、零样本数据分析具有巨大潜力。
引用
@article{arxiv.2404.00188,
title = {DataAgent: Evaluating Large Language Models' Ability to Answer Zero-Shot, Natural Language Queries},
author = {Manit Mishra and Abderrahman Braham and Charles Marsom and Bryan Chung and Gavin Griffin and Dakshesh Sidnerlikar and Chatanya Sarin and Arjun Rajaram},
journal= {arXiv preprint arXiv:2404.00188},
year = {2024}
}
备注
5 pages, Submitted to International Conference on AI in Cybersecurity