中文

SR-GRPO:基于稳定秩的大语言模型对齐

星系天体物理 2025-12-03 v1

摘要

大语言模型(LLM)的对齐通常依赖外部监督,但存在人工标注稀缺且主观、奖励模型易受奖励攻击以及自评估方法受提示敏感和偏差等关键限制。本文提出稳定秩(stable rank),一种源自模型表示的内在、无标注质量信号。稳定秩通过计算总方差与主导方向方差之比,衡量隐藏状态的有效维度,捕捉信息在表示维度分布情况。经验上,稳定秩在RewardBench上达到84.04%的准确率,并通过Best-of-N采样提升任务准确率平均提高11.3个百分点。基于此,我们引入稳定秩组相对策略优化(SR-GRPO),将稳定秩作为强化学习奖励信号。无需外部监督,SR-GRPO在Qwen2.5-1.5B-Instruct模型上在STEM领域提升10%,数学推理提升19%,超越学习型奖励模型和自评估基线。我们的发现表明,可从模型内部几何中提取质量信号,为无外部监督的可扩展对齐提供了路径。

关键词

引用

@article{arxiv.2512.02805,
  title  = {Direct observational evidence that higher-luminosity type 1 active galactic nuclei are most commonly triggered by galaxy mergers},
  author = {Yongmin Yoon and Yongjung Kim and Dohyeong Kim and Kyungwon Chun and Woowon Byun},
  journal= {arXiv preprint arXiv:2512.02805},
  year   = {2025}
}

备注

12 pages, 10 figures, 1 table, accepted for publication in A&A