GRP:基于大语言模型的零样本评估目标反转提示
计算与语言
2026-05-13 v2
摘要
成对的 LLM-as-a-judge 评估要求评判模型识别两个候选答案中\emph{更好}的一个。我们研究了一种单行修改方法,改为要求输出\emph{更差}的答案,并通过排除法恢复偏好,我们将此过程称为目标反转提示(GRP)。GRP 不引入额外的推理轮次,可与任何提示模板(直接、思维链或 Arena-Hard SOP)组合,且不改变评估流程的其余部分。两个观察结果激发了这种反转。逆向推理是人类解决问题时反复出现的策略;而现代经过指令微调的评判模型表现出正向偏好偏差,要求提供更差的答案可以抵消这一偏差。在 JudgeBench 上,采用严格的评估一致性协议(仅当两种响应顺序均与标准偏好一致时才将判定计为正确),GRP 在两种响应对来源下均改善了我们测试的所有三个闭源评判模型。对于 GPT-4o 生成的响应对,GPT-4o 的 Arena-Hard SOP 基准从 61.71% 提升至 66.23%(+4.52),Claude-3.5-Sonnet 从 60.00% 提升至 66.00%(+6.00),在推理和数学任务上取得了最大的绝对增益。当响应对来自 Claude-3.5-Sonnet,以及当 SOP 支架被简化为最小化的直接提示模板时,这种提升依然存在,这表明目标反转作用于底层的评判行为,而非特定的评分准则。较强的评判模型比较弱的模型获益更多,表明目标反转暴露了额外的推理能力,而非弥补其缺失。
关键词
引用
@article{arxiv.2503.06139,
title = {GRP: Goal-Reversed Prompting for Zero-Shot Evaluation with LLMs},
author = {Mingyang Song and Mao Zheng and Xuan Luo},
journal= {arXiv preprint arXiv:2503.06139},
year = {2026}
}
备注
Ongoing Work