中文

AMARIS:用于基于评分标准强化学习的记忆增强评分标准改进系统

机器学习 2026-05-27 v2 人工智能 计算与语言

摘要

基于评分标准的奖励塑形为通过强化学习(RL)微调 LLM 提供了可解释和可编辑的奖励信号,但现有的自适应评分标准方法通常从局部证据(如当前批次或实例级比较)更新标准。这种局部视角丢弃了训练期间产生的诊断信息,使得难以追踪反复出现的失败、评估先前的评分标准编辑或在早期标准饱和后提高标准。我们引入了 AMARIS,一个将评分标准更新建立在纵向训练证据基础上的记忆增强评分标准改进系统。AMARIS 将 rollout 分析、步骤级摘要和评分标准更新记录存储在持久评估记忆中,然后检索近期且语义相关的历史来修订评分标准。我们在科学、医学、指令遵循和创意写作领域,在全局和实例特定评分标准设置下评估了 AMARIS。AMARIS 优于静态、局部自适应和记忆消融基线,例如在 GPQA-Diamond 上比最强基线高 2.8 分,在 IFBench 上高 2.2 分,同时分析表明记忆减少了振荡的评分标准编辑,并支持从早期的失败纠正到后期的课程推进的进展。AMARIS 与正常 RL 循环异步运行,减少了相对于同步评分标准更新的阻塞延迟。

关键词

引用

@article{arxiv.2605.18592,
  title  = {AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning},
  author = {Peilin Wu and Xinlu Zhang and Kun Wan and Wentian Zhao and Gang Wu and Xinya Du and Zhiyu Chen},
  journal= {arXiv preprint arXiv:2605.18592},
  year   = {2026}
}

备注

Preprint. Under review