LAD:用于推理的学习优势分布
机器学习
2026-02-24 v1
摘要
当前的强化学习目标主要聚焦于最大化预期奖励,这种范式可能导致对占主导奖励信号的过拟合,同时忽略其他有效的推理轨迹,从而限制多样性和探索。为此,我们引入学习优势分布(LAD),一种分布匹配框架,将优势最大化替换为学习优势引导的分布。通过建立最优策略更新与优势基准分布之间的等价性,我们推导了一个实用的 LAD 目标,表述为最小化策略引导分布与优势引导分布之间的 -divergence。这导致一个提高高优势响应概率 likelihood的梯度更新,同时抑制过度自信概率增长,防止分布崩溃,不需要额外的熵正则化。LAD 的计算成本与 GRPO 不等,天然适用于 LLM 微调。在受控的 bandit 环境中,LAD 可靠地恢复优势分布的多模态性,验证了理论表述。在多个 LLM 主干模型上的数学和代码推理任务实验表明,LAD 可靠地提高了准确率和生成式多样性。
关键词
引用
@article{arxiv.2602.20132,
title = {LAD: Learning Advantage Distribution for Reasoning},
author = {Wendi Li and Sharon Li},
journal= {arXiv preprint arXiv:2602.20132},
year = {2026}
}