塑造解释:用于GRPO的基于纯编码器Transformer的语义奖励建模
计算与语言
2025-09-17 v1 人工智能
摘要
尽管大型语言模型(LLMs)在生成类人文本方面表现出色,但将其输出与复杂的定性目标(如教学合理性)对齐仍然是一个重大挑战。标准的强化学习技术通常依赖于缓慢且昂贵的LLM-as-a-judge评估,或依赖于脆弱的、基于关键词的指标(如ROUGE),这些指标无法捕捉高质量解释的语义本质。在这项工作中,我们引入了一种在组相对策略优化(GRPO)框架内进行奖励塑造的新方法。我们的核心贡献是使用一个小型、高效的纯编码器Transformer作为语义奖励模型。该模型基于生成解释与真实参考之间的余弦相似度,提供一个稠密、语义丰富的奖励信号,引导策略生成不仅在事实上正确,而且在结构和概念上与专家推理对齐的解释。我们将此方法应用于为意大利医学院入学考试训练模型的任务,遵循标准的领域自适应持续预训练(CPT)和监督微调(SFT)。我们的结果表明,与强大的SFT基线相比,采用我们提出的语义奖励的GRPO显著提高了解释的忠实度和清晰度,展示了在复杂生成任务中使用轻量级编码器模型进行细致奖励塑造的能力。
引用
@article{arxiv.2509.13081,
title = {Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO},
author = {Francesco Pappone and Ruggero Marino Lazzaroni and Federico Califano and Niccolò Gentile and Roberto Marras},
journal= {arXiv preprint arXiv:2509.13081},
year = {2025}
}