PromptSet:程序员提示数据集
软件工程
2024-02-28 v1
摘要
大语言模型所展现能力的崛起迅速引发了将这些复杂系统集成到应用层逻辑中。算法、程序、系统和公司都围绕着针对黑盒模型的结构化提示构建,其中大部分设计和实现工作在于捕捉和量化“代理模式”(agent mode)。塑造闭源语言模型的标准方法是通过定制提示为其特定任务进行预热(prime),这些提示通常最初由人工手写。文本提示与代码库共同演化,在项目生命周期中形成必须像传统代码文件一样进行审查和维护的制品。与传统代码不同,我们发现提示缺乏有效的静态测试和 linting 以防止运行时问题。在本工作中,我们提出了一个名为 PromptSet 的新数据集,包含超过 61,000 个在开源 Python 程序中使用的独特开发者提示。我们对该数据集进行了分析,并引入了提示静态 linting 的概念。随本出版物发布的是一个 HuggingFace 数据集和一个 Github 仓库,用于重现收集和处理工作,名称均为 \texttt{pisterlabs/promptset}。
引用
@article{arxiv.2402.16932,
title = {PromptSet: A Programmer's Prompting Dataset},
author = {Kaiser Pister and Dhruba Jyoti Paul and Patrick Brophy and Ishan Joshi},
journal= {arXiv preprint arXiv:2402.16932},
year = {2024}
}
备注
8 pages, ICSE '24 LLM4Code Workshop