PROMPTEVALS:面向定制生产级大语言模型流水线的断言与护栏数据集
计算与语言
2025-04-22 v1
摘要
大语言模型(LLM)正日益被部署于跨多个领域的专业生产数据处理流水线中——例如金融、营销和电子商务。然而,在生产环境中跨大量输入运行时,它们常常无法遵循指令或满足开发者的预期。为了提升这些应用中的可靠性,有必要为 LLM 输出创建与流水线并行运行的断言或护栏。然而,确定能够准确捕捉开发者任务需求的一组合适的断言颇具挑战性。本文介绍 PROMPTEVALS,一个包含 2087 条 LLM 流水线提示及其对应的 12623 条断言标准的数据集,来源于使用我们开源 LLM 流水线工具的开发者。该数据集规模是此前同类数据集的 5 倍。我们以 PROMPTEVALS 的留出测试集作为基准,评估了闭源与开源模型在生成相关断言方面的表现。值得注意的是,我们微调的 Mistral 与 Llama 3 模型平均比 GPT-4o 高出 20.93%,在降低延迟的同时提升了性能。我们相信该数据集将推动 LLM 可靠性、对齐与提示工程领域的进一步研究。
引用
@article{arxiv.2504.14738,
title = {PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines},
author = {Reya Vir and Shreya Shankar and Harrison Chase and Will Fu-Hinthorn and Aditya Parameswaran},
journal= {arXiv preprint arXiv:2504.14738},
year = {2025}
}
备注
Accepted to NAACL 2025 Main Conference