提示词锦标赛:通过结构化辩论与Elo评分演化LLM指令
人工智能
2025-07-24 v2 神经与进化计算
摘要
提示工程是充分发挥大型语言模型(LLM)解决复杂任务潜力的关键瓶颈,因为它需要专业知识、大量的试错以及人工干预。对于涉及主观质量评估的任务,这一挑战尤为突出,因为定义明确的优化目标在根本上存在困难。现有的自动化提示优化方法在这些场景中表现不佳,因为它们通常需要定义明确的特定任务数值适应度函数,或依赖于无法捕捉复杂用例细微需求的通用模板。我们引入了 DEEVO(DEbate-driven EVOlutionary prompt optimization,辩论驱动的演化式提示优化),这是一种通过基于 Elo 评分的选择和辩论驱动的评估来引导提示演化的新颖框架。与先前的工作不同,DEEVO 的方法能够探索离散的提示空间,同时通过结合基于辩论反馈的智能交叉和策略性变异操作来保持语义连贯性,根据识别出的优势而非任意拼接,将成功与不成功提示中的元素结合起来。以 Elo 评分作为适应度代理,DEEVO 在推动改进的同时保持了提示群体中有价值的多样性。实验结果表明,尽管未使用真实标签反馈,DEEVO 在开放式和封闭式任务上均显著优于人工提示工程和其他替代的最先进优化方法。通过将 LLM 的推理能力与自适应优化相结合,DEEVO 消除了对预定指标的需求以持续改进 AI 系统,代表了提示优化研究的重要进展。
引用
@article{arxiv.2506.00178,
title = {Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings},
author = {Anirudh Nair and Adi Banerjee and Laurent Mombaerts and Matthew Hagen and Tarik Borogovac},
journal= {arXiv preprint arXiv:2506.00178},
year = {2025}
}