通过 Frank-Wolfe 自博弈进行纯探索
机器学习
2025-09-25 v1 计算机科学与博弈论
统计理论
机器学习
统计理论
摘要
我们研究结构化随机多臂赌博机中的纯探索问题,旨在高效地从有限备选假设中识别出正确假设。对于广泛的任务类别,渐近分析可归结为一种极大极小优化,该优化可解释为实验者与怀疑者之间的二人零和博弈:实验者分配测量以排除备选假设,而怀疑者提出备选假设。我们通过允许怀疑者采用混合策略来重新表述该博弈,从而得到一个凹-凸鞍点问题。这一视角引出了 Frank-Wolfe 自博弈(FWSP):一种无投影、无正则化、无调参的方法,其在双方的一热更新与赌博机采样范式相匹配。然而,结构约束引入了尖锐的病理现象,使算法设计与分析变得复杂:我们的线性赌博机案例研究表现出非唯一最优解、最优设计在最优臂上具有零质量、双线性目标函数以及边界处的非光滑性。我们通过微分包含论证来解决这些挑战,证明了线性赌博机中最优臂识别博弈值的收敛性。我们的分析通过连续时间极限进行:具有指数衰减 Lyapunov 函数的微分包含,意味着对偶间隙消失并收敛到最优值。尽管 Lyapunov 分析需要目标函数的可微性,而边界处无法保证,我们证明沿连续轨迹算法能够远离病理性的非光滑点,并实现向最优博弈值的均匀全局收敛。随后我们将离散时间更新嵌入扰动流中,并证明离散博弈值同样收敛。基于 FWSP,我们进一步提出了一种基于后验采样的学习算法。数值实验表明对偶间隙趋于消失。
引用
@article{arxiv.2509.19901,
title = {Pure Exploration via Frank-Wolfe Self-Play},
author = {Xinyu Liu and Chao Qin and Wei You},
journal= {arXiv preprint arXiv:2509.19901},
year = {2025}
}