中文

SibylSense:通过记忆调优和对抗探针实现自适应评分标准学习

计算与语言 2026-02-25 v1 人工智能 机器学习

摘要

设计对开放式生成任务具有对齐性和鲁棒性的奖励机制,仍是RL后训练中的关键障碍。评分标准提供结构化且可解释的监督,但其规模化构建面临挑战:专家评分标准成本高昂、提示式评分标准常显得浅薄或不一致,固定池子判别式评分标准容易饱和和漂移,从而导致奖励作弊。我们提出SibylSense,一种推理时学习方法,通过可调记忆库对冻结的评分标准生成器进行适应性调整。记忆库通过验证器计算的项目奖励进行更新,这些奖励通过少量示例中参考答案与候选答案之间的判别性差距进行衡量。SibylSense交替进行记忆调优和评分标准对抗策略更新,后者产生满足评分标准的候选答案,缩小判别性差距,引导评分标准生成器捕捉新的质量维度。在两个开放式任务上的实验表明,SibylSense生成的评分标准更具判别性,提升了下游RL性能,优于静态和非自适应基线方法。

关键词

引用

@article{arxiv.2602.20751,
  title  = {SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing},
  author = {Yifei Xu and Guilherme Potje and Shivam Shandilya and Tiancheng Yuan and Leonardo de Oliveira Nunes and Rakshanda Agarwal and Saeid Asgari and Adam Atkinson and Emre Kıcıman and Songwu Lu and Ranveer Chandra and Tusher Chakraborty},
  journal= {arXiv preprint arXiv:2602.20751},
  year   = {2026}
}