提示优化是硬币抛掷:诊断复合 AI 系统中何时有帮助
人工智能
2026-05-28 v2 计算与语言
摘要
复合 AI 系统中的提示优化与硬币抛掷一样统计上不可区分:在 72 次优化实验中(6 中方法 × 4 个任务 × 3 次重复),49% 的得分低于零-shot;在 Amazon Nova Lite 上,失败率更高。然而在一个任务上,所有六种方法都超过零-shot,提升最高达 +6.8 分。是什么区别了成功与失败?我们通过 18,000 次网格评估和 144 次优化实验进行调查,测试了 TextGrad 和 DSPy 等端到端优化工具背后的两个假设:(A)代理提示之间存在相互作用,需联合而非独立优化;(B)单个提示是否值得优化。相互作用从未显著(,所有 ),优化仅在任务具有可被模型产生但默认不采纳的输出结构时才有帮助。我们进一步给出机制性解释:指令微调将输入措辞压缩为狭窄的输出分布,消除了联合优化所假设的措辞敏感性。我们提供两个诊断工具:80 美元的 ANOVA 预检用于检测代理间耦合,以及 10 分钟的"头寸测试"预测优化是否值得,将硬币抛掷转化为明智的决策。
引用
@article{arxiv.2604.14585,
title = {Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems},
author = {Xing Zhang and Guanghui Wang and Yanwei Cui and Wei Qiu and Ziyuan Li and Bing Zhu and Peiyang He},
journal= {arXiv preprint arXiv:2604.14585},
year = {2026}
}
备注
Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea