光滑门函数用于软优势策略优化
机器学习
2026-03-26 v2 人工智能
摘要
群相对策略优化 (GRPO) 已显著推进了大型语言模型的训练并提升了其推理能力,但由于使用硬性剪裁仍然容易受到不稳定性的影响。软自适应策略优化 (SAPO) 通过用基于 sigmoid 的光滑门函数取代剪裁,解决了这一限制,导致更新更加稳定。我们决定进一步推进这一理论,探讨不同门函数对训练稳定性和最终模型性能的影响。我们形式化了可接受门应满足的关键属性,并识别了若干此类函数进行经验评估。这篇论文基于在数学推理任务上使用 Qwen2.5-7B-Instruct 模型进行的实验,呈现了我们的发现分析。这些结果为设计更光滑和更稳健的策略优化目标提供了实际指导。
引用
@article{arxiv.2602.19345,
title = {Smooth Gate Functions for Soft Advantage Policy Optimization},
author = {Egor Denisov and Svetlana Glazyrina and Maksim Kryzhanovskiy and Roman Ischenko},
journal= {arXiv preprint arXiv:2602.19345},
year = {2026}
}