AURORA:基于集成提示和逆向验证的通用过程奖励模型自动训练框架
计算与语言
2025-02-18 v1
摘要
高级大型语言模型(LLM)如 o1 的推理能力已彻底改变人工智能应用。然而,由于政策分布多样且人类努力和准确性的内在局限性,评估和优化复杂推理过程仍是重大挑战。本文提出 AURORA,一款新颖的自动化框架,用于通过集成提示和逆向验证训练通用过程奖励模型(PRM)。该框架采用两阶段方法:首先,使用多样化的提示策略和集成方法进行自动化标注和过程评估,确保奖励学习的稳健评估;其次,利用实际参考答案进行逆向验证,增强模型对输出的验证能力,提高训练准确性。为评估框架性能,我们在现有 ProcessBench 基准之外引入 UniversalBench,评估在多样化政策分布下、包含长链思维(CoT)输出的完整轨迹上的奖励预测。实验结果表明,AURORA 提升了过程评估准确性,改进了针对多样化政策分布和长 CoT 响应的 PRM 准确性。该项目将在 https://auroraprm.github.io/ 开源。Universal-PRM-7B 已在 https://huggingface.co/infly/Universal-PRM-7B 提供。
引用
@article{arxiv.2502.11520,
title = {AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification},
author = {Xiaoyu Tan and Tianchu Yao and Chao Qu and Bin Li and Minghao Yang and Dakuan Lu and Haozhe Wang and Xihe Qiu and Wei Chu and Yinghui Xu and Yuan Qi},
journal= {arXiv preprint arXiv:2502.11520},
year = {2025}
}
备注
Under Review