PEEM:用于可解释联合评估提示词和响应的提示工程评估指标
摘要
提示词设计是大型语言模型(LLM)的主要控制接口,但标准评估大致将性能简化为答案的正确性,这掩盖了提示词为何成功或失败的原因,以及为实际改进提供的建议。我们提出PEEM(Prompt Engineering Evaluation Metrics),即一种用于联合且可解释评估提示词和响应的统一框架。PEEM定义了一个包含9个维度的结构化评分标准:3个提示词标准(清晰度/结构、语言质量、公平性)和6个响应标准(准确性、连贯性、相关性、客观性、清晰性、简洁性),并使用基于LLM的评估器输出(i)在1-5 Likert比例尺上的标量得分,以及(ii)以评分标准为依据的、针对性的自然语言理由。我们在7个基准测试和5个任务模型上进行实验,发现PEEM的准确性轴与常规准确性高度一致,同时保持模型排名(平均Spearman rho约为0.97,Pearson r约为0.94,p < 0.001)。四个模型的多评估器研究显示,一致的相对判断(两两配对rho为0.68-0.85),支持评估器无关的部署。除了对齐外,PEEM捕捉到补充的语言失效模式,在提示词变更情况下仍保持信息性:提示词质量趋势在反复修改后跟踪下游准确性,语义对抗性变更导致明显得分下降,意义保持的改写后译稿表现出高稳定性(鲁棒性约为76.7-80.6%)。最后,仅使用PEEM得分和理由作为反馈,零样提示词重写循环可使下游准确性提升最高11.7分,超越监督和基于强化学习的提示词优化基线。总体而言,PEEM提供了一个可复现、以标准为导向的协议,将提示词表述与响应行为联系起来,使我们能够系统性地诊断和优化LLM交互。
引用
@article{arxiv.2603.10477,
title = {PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses},
author = {Minki Hong and Eunsoo Lee and Sohyun Park and Jihie Kim},
journal= {arXiv preprint arXiv:2603.10477},
year = {2026}
}
备注
This is a preprint version of a paper accepted to IEEE Access. The final published version is available at DOI: 10.1109/ACCESS.2026.3679809