基于 Best Response 流的非凸熵正则化平均场优化
最优化与控制
2025-10-16 v2 机器学习
概率论
摘要
我们研究了在概率测度空间上最小化非凸泛函的问题,该问题通过相对于固定参考测度的相对熵(KL 散度)进行正则化,以及求解熵正则化的非凸非凹极小极大问题的对应问题。我们利用 Best Response 流(在文献中也称为虚拟博弈流),并研究其收敛性如何受到所考虑泛函的非凸程度、正则化参数和参考测度的尾部行为之间关系的影响。特别地,我们展示了在给定非凸泛函的情况下如何选择正则化器,使得 Best Response 算子相对于 -Wasserstein 距离成为一个压缩映射,这保证了其唯一不动点的存在性,随后证明该不动点是我们优化问题的唯一全局极小值点。这扩展了最近的结果,其中 Best Response 流被应用于求解相对于任意参考测度以任意正则化参数值进行相对熵正则化的凸优化问题。我们的结果精确地解释了如何以做出特定正则化器选择为代价,放宽凸性假设。此外,我们展示了这些结果如何应用于平均场机制下具有 softmax 参数化策略的马尔可夫决策过程和马尔可夫博弈的策略优化中的强化学习。
引用
@article{arxiv.2505.22760,
title = {Non-convex entropic mean-field optimization via Best Response flow},
author = {Razvan-Andrei Lascu and Mateusz B. Majka},
journal= {arXiv preprint arXiv:2505.22760},
year = {2025}
}
备注
NeurIPS 2025