中文

黑暗中的反思:暴露并逃离反射式提示优化中的黑箱

人工智能 2026-03-20 v1 多智能体系统

摘要

自动提示优化(APO)已成为一种强大的范式,用于在不进行手动提示工程的情况下提高 LLM 的性能。诸如 GEPA 等反射式 APO 方法通过诊断失败案例来迭代细化提示,但优化过程仍然是黑箱且无标签的,导致不可解释的轨迹和系统性失败。我们识别并经验地演示了四个局限性:在 GSM8K 上使用有缺陷的初始提示时,GEPA 将准确率从 23.81% 降至 13.50%。我们提出了 VISTA,一种多智能体 APO 框架,通过解耦假设生成和提示重写,实现语义标记的假设、并行小批量验证以及可解释的优化轨迹。一种两层探索-开发机制结合随机重启和 epsilon 贪婪采样进一步逃离局部最优。VISTA 在同一有缺陷的初始提示上恢复了准确率至 87.57%,并在 GSM8K 和 AIME2025 上的所有条件下一致优于基线方法。

关键词

引用

@article{arxiv.2603.18388,
  title  = {Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization},
  author = {Shiyan Liu and Qifeng Xia and Qiyun Xia and Yisheng Liu and Xinyu Yu and Rui Qu},
  journal= {arXiv preprint arXiv:2603.18388},
  year   = {2026}
}