贝尔斯顿竞争下随机一阶算法的收敛性分析
计算机科学与博弈论
2026-05-19 v1
摘要
自主定价代理人广泛部署于在线市场,使算法定价成为多代理学习的突出应用领域。实验研究常报告协作结果,但这些发现通常依赖于完全信息环境下的 Q 学习,且缺乏严格的收敛保证。本文研究了在贝叶斯 Bertrand 竞争(具有私有成本)下的 Regularized Robbins-Monro (RRM) 算法的随机学习动力学。我们证明,该设置违反了标准稳定性条件,包括单调性和 Minty 变分不等式,使得经典的梯度-based 学习收敛结果无法适用。尽管如此,我们证明了欧几里得 RRM 算法在策略空间的有限维近似中几乎必然收敛于唯一的高效 Bayes-Nash 均衡。通过分析 duopoly 中的对称分段线性定价策略,我们显式构造了一个全局 Lyapunov 函数,用于证明投影 primal 动力学的全局渐近稳定性。我们的分析为贝叶斯 Bertrand 竞争中的随机一阶学习算法提供了严格的收敛保证,并为算法性协作的广泛宣称提供了原则性的反例。
引用
@article{arxiv.2605.17607,
title = {Convergence of Stochastic First-Order Algorithms in Bertrand Competition Under Incomplete Information},
author = {Martin Bichler and Jan-Sebastian Hoehener},
journal= {arXiv preprint arXiv:2605.17607},
year = {2026}
}