超越静态快照:面向智能体前沿的语言模型扎实评估框架
摘要
我们指出,当前针对大型语言模型 (LLM) 的评估框架存在四种系统性缺陷,导致其在部署式智能体系统中结构性地不足:分布式失效、时序失效、范围失效与过程失效。这些缺陷在 RLHF 中相互叠加,使得奖励作弊成为评估设计的可预见结果,而非训练过程的不可预见病态。此外,RLHF 的双模型架构也引入了硬件障碍,限制了评估的可复现性。我们提出 Grounded Continuous Evaluation (GCE) 框架,并展示了作为参考实现的 ISOPro。ISOPro 用确定性验证器取代学习型奖励模型,在可验证奖励领域中通过设计消除奖励作弊;同时在 CPU 上更新 LoRA adapter,硬件门槛降低了一个数量级。我们在三个架构 (Qwen 2.5 3B、Llama 3.2 3B、Gemma 2 2B) 和两个领域 (调度、MBPP) 上验证了 ISOPro,并与 GRPO-LoRA 在头盲匹配计算上的对比显示:在十二个实验单元中,ISOPro 获得了最大的绝对能力提升 (+25.6、+22.2、+16.0pp),平均提升 +9.0pp,最差回归 -5.6pp;而 GRPO-LoRA 在消费级超参数下仅达到较小的峰值提升 (+8.5pp),更深的 worst-case 回归 (-10pp),且平均 delta 为 -1.5pp。在 MBPP 的 held-out 组合推理测试中,ISOPro 在两个架构上达到 40% (包括 Qwen 2.5 3B 从 0% 跳跃至 40%),而 GRPO-LoRA 在一个架构上仅达到 20%。我们描述了一种缓冲区偏斜失效模式,即隐式课程可能在三种前提条件下侵蚀既有 tier 能力,并提出三种相应的缓解措施。该工作与 DeepSeek-R1 的 GRPO 同时在大规模上得出相同结论:在可验证奖励领域,验证器即为奖励信号。
引用
@article{arxiv.2604.17573,
title = {Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier},
author = {Jazmia Henry},
journal= {arXiv preprint arXiv:2604.17573},
year = {2026}
}
备注
Submitted for consideration to NeurIPS 2026