基于实例的符号程序与提示程序性能预测
机器学习
2026-05-22 v1 人工智能
摘要
LLM 提示在用于自然语言任务时广泛应用,但其不可靠性较大:可能仅在少数测试案例中成功,却在部署时失败。我们研究性能预测:给定程序(符号程序如 Python 或在 LLM 上执行的提示程序)和少数领域内示例,预测其在同一领域未见任务上的性能。我们采用简单硬币投掷模型,将每个通过/失败的程序执行视为伯努利随机变量,其成功概率即程序未知的性能。在该模型中,性能完全取决于:1) 在测试案例上的观察执行结果,以及2) 对性能的先验分布。我们从多样化的程序和任务语料库中编译经验性性能先验,发现符号程序(如 Python)的性能是要么全通过要么全失败,而提示程序则具有分散的先验,包含许多接近正确的程序。这种差异解释了为何仅靠少数通过测试即可认证符号程序却无法认证提示程序。基于这一洞见,我们开发了 RAP(检索近似先验),从现有语料库中检索相似任务和提示程序以构建代理先验,然后用于性能预测。我们表明 RAP 能实现稳健的性能。
引用
@article{arxiv.2605.21515,
title = {Predicting Performance of Symbolic and Prompt Programs with Examples},
author = {Chengqi Zheng and Keya Hu and Shuzhi Liu and Tao Wu and Kevin Ellis and Yewen Pu},
journal= {arXiv preprint arXiv:2605.21515},
year = {2026}
}