非可加长期约束下的在线优化与遗憾保证
机器学习
2016-06-09 v2 机器学习
最优化与控制
统计理论
统计理论
摘要
我们考虑 1-lookahead 设置中的在线优化,其中目标不在在线博弈的各轮上可加分解。该公式使我们能处理非平稳和/或长期约束,例如出现在在线展示广告问题中。我们提出一种在线原始对偶算法,对其我们获得动态累积遗憾保证。它们依赖于非可加惩罚的凸性和平滑性,以及捕获非平稳和长期约束残差在各轮变化平滑性的项。我们在合成数据上实验以说明非可加惩罚的好处,并展示在展示广告平台生产环境中收集的实时流量数据上消失的遗憾收敛。
引用
@article{arxiv.1602.05394,
title = {Online optimization and regret guarantees for non-additive long-term constraints},
author = {Rodolphe Jenatton and Jim Huang and Dominik Csiba and Cedric Archambeau},
journal= {arXiv preprint arXiv:1602.05394},
year = {2016}
}