策略控制广义份额:面向严格在线切换预言机跟踪的通用框架与 Transformer 实例化
机器学习
2026-03-31 v1 统计金融
摘要
对单一专家的静态遗憾通常不是严格在线预测在非平稳性下的正确目标,因为最佳专家可能随时间反复切换。我们研究了策略控制广义份额(PCGS),这是一个严格在线框架,其中广义份额递归是固定的,而后损失更新控制允许自适应变化。本文的主要实例化是 PCGS-TF,它使用因果 Transformer 作为更新控制器:在第 轮结束并观察到损失向量后,Transformer 输出将 映射到 的控制,而不改变已提交的决定 。在可容许的后损失更新控制下,我们获得了针对通用时变学习率的路径加权遗憾保证,以及在恒定学习率特化下针对任意最多 次切换的专家路径的标准动态遗憾保证。在经验上,在受控的合成套件上通过精确动态规划切换预言机评估,PCGS-TF 在所有七个非平稳族中取得了最低的平均动态遗憾,其优势随专家池增大而增加。在复现的家庭用电基准测试上,PCGS-TF 在 时也取得了最低的归一化动态遗憾。
引用
@article{arxiv.2603.28198,
title = {Policy-Controlled Generalized Share: A General Framework with a Transformer Instantiation for Strictly Online Switching-Oracle Tracking},
author = {Hongkai Hu},
journal= {arXiv preprint arXiv:2603.28198},
year = {2026}
}
备注
44 pages, 6 figures, 5 tables, 1 algorithm. Includes appendix and reproducibility-oriented experiments