CP-Agent:面向反馈驱动的竞赛编程中可校准风险控制的智能体
计算与语言
2026-05-26 v1
摘要
大型语言模型在赛题级编程中仍面临挑战,而许多智能体方法依赖大规模推理时间抽样或昂贵的多阶段后训练。我们研究执行反馈何时可靠地帮助LLM CP求解器以及哪些机制主导所获收益。我们将反馈驱动求解建模为一个可校准的停止过程,并识别了三个量:错误引入风险、针对差程序的程序层面证据以及主动状态成功危险。基于持留抽样校准并从预声明的有限控制器清单中进行选择,结果结构证书在错误引入前下界干净的成功概率。我们实现针对这些量的机制:双粒度验证、测试数据增强和经验驱动自演化,生成CP-Agent。无需更新任何参数,CP-Agent在LiveCodeBench Pro上将Pass@1从25.8%提升至48.5%,在ICPC-Eval上将Refine@5提高11.0%。在三个LLM backbone上,CP-Agent位于成本-准确率效率前沿,消融实验表明每个组件主要影响其对应的证书量。
引用
@article{arxiv.2605.24693,
title = {CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming},
author = {Peisong Wang and Bowen Liu and Zehua Li and Yuyao Wang and Zhiwei Ma and Yuhan Li and Jia Li},
journal= {arXiv preprint arXiv:2605.24693},
year = {2026}
}
备注
Code: https://github.com/NineAbyss/CP-Agent