中文

提示稳定性至关重要:评估与优化通用系统中的自动生成提示

人工智能 2025-05-21 v1 计算与语言 多智能体系统

摘要

自动提示生成在使通用多智能体系统自主执行多样化任务方面发挥着关键作用。现有方法通常仅根据提示的即时任务性能进行评估,忽视了决定其可靠性的内在特质。这种以结果为中心的视角不仅限制了可解释性,也未能考虑大语言模型(LLM)固有的随机性。本工作中,我们关注提示稳定性——即模型在多次执行中响应的一致性——作为构建鲁棒且有效的提示生成系统的关键因素。为量化这一概念,我们提出语义稳定性作为评估提示响应一致性的标准,并微调了一个基于 LLaMA 的评估器来自动跨任务测量它。这些组件使我们能够开发首个稳定性感知的通用提示生成系统,该系统利用稳定性反馈迭代提升提示质量与系统级性能。此外,我们通过分析系统中的结构依赖关系,建立了提示稳定性与任务成功之间的逻辑链,证明了稳定性是有效系统级执行的必要条件。在通用任务和领域特定任务上的实证结果表明,我们的稳定性感知框架同时提升了准确性和输出一致性。通过将关注点从一次性结果转向持续可靠性,本工作为提示设计提供了新视角,并为构建更可信的通用系统贡献了实用工具。

关键词

引用

@article{arxiv.2505.13546,
  title  = {Prompt Stability Matters: Evaluating and Optimizing Auto-Generated Prompt in General-Purpose Systems},
  author = {Ke Chen and Yufei Zhou and Xitong Zhang and Haohan Wang},
  journal= {arXiv preprint arXiv:2505.13546},
  year   = {2025}
}