科学报告提示工程1:提示工程复杂且具有依赖性
计算与语言
2025-03-10 v1 人工智能
摘要
这是一系列短报告的第一篇,旨在帮助企业、教育和政策领导者通过严格测试来理解与 AI 合作的技术细节。本报告展示了两件事:- 没有单一的标准来衡量大型语言模型 (LLM) 是否通过基准测试,而且选择哪个标准对 LLM 在该基准测试中的表现有着巨大的影响。你选择的标准将取决于你希望在特定情况下使用 LLM 的目标。- 不容易预先知道特定的提示方法是否会帮助或损害 LLM 回答特定问题的能力。具体而言,我们发现对 LLM 的礼貌有时会提高性能,有时会降低性能。我们也发现,在某些情况下约束 AI 的答案有助于提高性能,但在其他情况下则可能降低性能。综上所述,这表明对 AI 性能进行基准测试并非一刀切,而且特定的提示公式或方法,例如对 AI 表示礼貌,并非在所有情况下都有价值。
引用
@article{arxiv.2503.04818,
title = {Prompting Science Report 1: Prompt Engineering is Complicated and Contingent},
author = {Lennart Meincke and Ethan Mollick and Lilach Mollick and Dan Shapiro},
journal= {arXiv preprint arXiv:2503.04818},
year = {2025}
}