具有历史平均依赖成本的在线决策(扩展版)
机器学习
2023-12-12 v1 系统与控制
系统与控制
摘要
在许多在线序列决策场景中,学习者的选择不仅影响其当前成本,还会影响未来的成本。在这项工作中,我们研究此类情况的一个特例,即成本取决于历史时间窗口内过去决策的时间平均值。我们首先将这种具有历史依赖成本的问题重新表述为在阶段约束下的决策问题。为解决此问题,我们随后提出了新颖的“自适应正则化跟随领导者”(FTARL)算法。我们的创新算法结合了明确依赖于过去决策的自适应正则化项,使我们能够强制执行阶段约束,同时建立紧的遗憾界。我们还讨论了历史窗口长度对我们问题中无遗憾算法设计的影响,并给出了当历史窗口为整个学习周期时的不可行结果。
引用
@article{arxiv.2312.06641,
title = {Online Decision Making with History-Average Dependent Costs (Extended)},
author = {Vijeth Hebbar and Cedric Langbort},
journal= {arXiv preprint arXiv:2312.06641},
year = {2023}
}
备注
Submitted to L4DC 2024. This is an extended version including proofs and experimental results