中文

CompassVerifier:用于 LLM 评估与结果奖励的统一可靠验证器

计算与语言 2025-08-06 v1 人工智能

摘要

答案验证不仅对于通过匹配大型语言模型(LLM)的非结构化输出与标准答案来评估 LLM 至关重要,还可作为指导 LLM 优化的奖励模型。在评估框架中,大多数方法依赖正则化匹配或采用通用 LLM 进行答案验证,这需要针对正则表达式规则或评估提示进行大量、重复的定制化。在当前方法中仍存两个根本性局限:1) 缺乏全面的基准,系统评估不同 LLM 的验证能力;2) 验证器的开发处于初级阶段,现有方法既不具备处理复杂边缘情况的鲁棒性,也不具备跨域的通用性。在本工作中,我们开发了CompassVerifier,一个用于评估和结果奖励的准确、轻量且稳健的验证模型。它展示出涵盖数学、知识和多种推理任务的多域能力,能够处理各种答案类型,包括子问题、公式和序列答案,同时有效识别异常/无效响应。我们引入VerifierBench基准,包含来自多个数据源收集的模型输出,通过对 metaerror 模式的手动分析进行增强,以提升CompassVerifier。我们预计CompassVerifier和VerifierBench将促进答案验证、评估协议和强化学习研究。代码和数据集均可于 https://github.com/open-compass/CompassVerifier 获取。

关键词

引用

@article{arxiv.2508.03686,
  title  = {CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward},
  author = {Shudong Liu and Hongwei Liu and Junnan Liu and Linchen Xiao and Songyang Gao and Chengqi Lyu and Yuzhe Gu and Wenwei Zhang and Derek F. Wong and Songyang Zhang and Kai Chen},
  journal= {arXiv preprint arXiv:2508.03686},
  year   = {2025}
}

备注

Technical Report; 31 Pages