中文

PRISM:面向企业级对话式AI的迭代仿真与监控提示可靠性框架

人工智能 2026-05-18 v1

摘要

在企业环境中部署由大语言模型(LLM)驱动的对话式智能体,需要提示词在发布时即正确无误,并能抵御生产环境中LLM部署所特有的非确定性行为漂移。现有的提示词优化框架将提示词质量视为一次性的编译时问题,而忽略了同样关键的问题:如何检测并修复因LLM行为随时间静默变化而导致的提示词性能退化。我们提出PRISM(通过迭代仿真与监控实现提示可靠性),这是一个闭环框架,将提示词工程视为一个持续的可靠性工程问题,而非一次性编写任务。PRISM以自然语言描述的智能体需求、一组已配置的工具和记忆变量以及一个初始草稿提示词作为输入。它自动从需求生成测试用例,在平台仿真的LLM环境中模拟完整的多轮对话,使用LLM作为裁判评估通过/失败,诊断失败的根本原因,并精准修复提示词——迭代直至所有测试通过。至关重要的是,PRISM被设计为按计划(每日)运行,将LLM行为漂移视为首要的可靠性问题。我们在Yellow.ai V3平台上对35个企业级对话式智能体进行了为期三周的部署评估。PRISM将提示词编写时间中位数从2天缩短至30分钟以内,在所有评估的智能体上实现了99%的生产可靠性,并在24小时检测窗口内成功识别并修复了由LLM行为漂移引起的生产环境退化。我们的结果表明,持续的、仿真驱动的提示词优化对于大规模可靠的企业级对话式AI既是可行的,也是必要的。

关键词

引用

@article{arxiv.2605.15665,
  title  = {PRISM: Prompt Reliability via Iterative Simulation and Monitoring for Enterprise Conversational AI},
  author = {Keshava Chaitanya and Jahnavi Gundakaram},
  journal= {arXiv preprint arXiv:2605.15665},
  year   = {2026}
}

备注

12 pages, 1 figure, 5 tables. arXiv preprint