中文

超越Softmax与熵:基于f-SoftArgmax参数化与耦合正则化的策略梯度收敛速率

机器学习 2026-04-02 v2

摘要

策略梯度方法已知对策略参数化的选择高度敏感。特别是,广泛使用的softmax参数化可能导致病态的优化景观,并导致指数级缓慢的收敛。虽然这可以通过预条件处理来缓解,但这种解决方案通常计算成本高昂。相反,我们建议用基于广义f-softargmax的替代策略参数化族来替换softmax。我们进一步主张将这种参数化与由相同f-散度诱导的正则化器耦合,这改善了优化景观,并确保所得的正则化目标满足Polyak-Lojasiewicz不等式。利用这一结构,我们为有限MDP上的随机策略梯度方法建立了首个显式的非渐近最后迭代收敛保证,无需任何形式的预条件处理。我们还推导了无正则化问题的样本复杂度界,并表明使用Tsallis散度的f-PG实现了多项式样本复杂度,而标准softmax参数化则导致指数复杂度。

关键词

引用

@article{arxiv.2601.12604,
  title  = {Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization},
  author = {Safwan Labbi and Daniil Tiapkin and Paul Mangold and Eric Moulines},
  journal= {arXiv preprint arXiv:2601.12604},
  year   = {2026}
}