中文

使用无后悔算法是否会导致学习者后悔?一种控制理论视角下的性能优势研究

系统与控制 2026-03-04 v1 系统与控制

摘要

无后悔学习动力学确保学习者在渐近意义上实现的平均奖励不劣于任何固定策略。这种无后悔保证并不确定渐近平均奖励的值。事实上,当面对相同环境时,不同的无后悔学习动力学可能在两者都保证无后悔属性的前提下表现出不同的渐近平均奖励。本文询问是否存在一种“免费馈饼”现象在无后悔算法之间。也就是说,是否存在一种无后悔学习规则在所有奖励环境下均均匀优于另一种无后悔学习规则。换言之,学习者是否会后悔没有使用某种特定的无后悔算法?我们考虑广义复制动力学(RD)作为线性时不变(LTI)系统与 softmax 非线性之间的级联联接。改变该 LTI 系统会导致不同的复制动力学实现,包括所谓的预期 RD、指数 RD 以及其他形式的高阶 RD。将 LTI 系统设置为积分器可实现标准 RD,这已知满足无后悔属性。在此框架下,我们分析并比较各种广义 RD 实现形式,通过改变 LTI 系统来实现。我们首先将性能比较形式化为相关比较系统的被动性属性,并建立“局部”支配结果,即比较近似均衡奖励向量的渐近性能。随后,我们将一种形式的预期 RD 与标准 RD 的性能比较建模为最优控制问题。我们表明,最小可实现累积奖励间隙为零,从而在所有奖励环境中建立了预期 RD 的全局支配,确立了无后悔学习动力学之间的“免费馈饼”。

关键词

引用

@article{arxiv.2603.03173,
  title  = {Can a Learner Regret Using a No-Regret Algorithm? A Control-Theoretic Study of Performance Dominance},
  author = {Hassan Abdelraouf and Jeff S. Shamma},
  journal= {arXiv preprint arXiv:2603.03173},
  year   = {2026}
}