ContraPrompt: 通过二元推理轨迹分析进行对比提示优化
摘要
提示优化方法要么孤立地分析单个失败案例,要么跨示例比较提示变体,它们都基于单一的执行轨迹,无法访问区分同一输入上成功与失败的推理过程。我们提出ContraPrompt,它基于以下观察:当模型失败但在带反馈的重试中成功时,其两条思维链轨迹之间的差异构成了先前方法未能捕捉到的优化信号。与先前的对比方法不同,我们比较完整的中间推理过程:两条轨迹共享模型、输入和基础提示,因此剩余差异反映了推理策略和附加的错误反馈——我们称之为二元推理轨迹分析。多轮求解阶段是一个仪器化的智能体重试循环,无需人工标注即可自动生成对比数据。提取的规则被组织成一个输入感知的决策树,根据可观测的输入特征路由指令。在四个推理和合规性基准测试上,ContraPrompt在所有四个测试中均优于GEPA (Agrawal et al., 2026),在HotPotQA上绝对提升+8.29个百分点(相对提升+20.8%),在GDPR-Bench上绝对提升+2.21个百分点(相对提升+18.2%),在GPQA Diamond上绝对提升+7.14个百分点(相对提升+10.6%),在BBH上绝对提升+0.74个百分点(相对提升+0.85%)。消融实验证实二元轨迹对比性是关键组成部分,移除后相对平均性能下降-16%。在53个EvalSet黑盒优化问题上,在相同预算下,ContraPrompt在11个问题上击败GEPA,在41个问题上持平,在1个问题上落败。在FiNER-139金融命名实体识别任务(Loukas et al., 2022)上,ContraPrompt比未优化基线绝对提升+7.77个百分点(相对提升+11.6%),比GEPA绝对提升+1.94个百分点(相对提升+2.66%),其分支条件与美国通用会计准则(US GAAP)的金融工具类别一致。
引用
@article{arxiv.2604.17937,
title = {ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis},
author = {Rishav Rishav and Pushpak Pujari and Pushpendre Rastogi},
journal= {arXiv preprint arXiv:2604.17937},
year = {2026}
}