通过双重镜像下降的联合在线学习与决策
机器学习
2021-04-21 v1 最优化与控制
摘要
我们考虑一个有限时间范围内的在线收益最大化问题,其成本受上下界约束。在每一周期,智能体接收一个从未知分布中独立同分布采样的上下文向量,并需要自适应地做出决策。收益和成本函数依赖于上下文向量以及某个固定但可能未知的待学习参数向量。我们提出了一种新颖的离线基准和一种新算法,该算法将在线双重镜像下降方案与通用参数学习过程相混合。当参数向量已知时,我们证明了 的遗憾界以及对可能约束违反的 界。当参数未知且必须学习时,我们证明遗憾和约束违反等于前述 项之和加上直接依赖于学习过程收敛性的项。
引用
@article{arxiv.2104.09750,
title = {Joint Online Learning and Decision-making via Dual Mirror Descent},
author = {Alfonso Lobos and Paul Grigas and Zheng Wen},
journal= {arXiv preprint arXiv:2104.09750},
year = {2021}
}