用于可扩展且动态物联网管理的 Bandit 凸优化
机器学习
2018-08-29 v1 网络与互联网体系结构
摘要
本文研究涉及时变损失函数和时变约束的在线凸优化问题。学习者无法完全获知损失函数,仅在查询点处揭示函数值(即 bandit feedback)。约束在做出决策后揭示,允许瞬时违反,但必须在长期内得到满足。该设定非常契合新兴的在线网络任务,如物联网 (IoT) 中的雾计算,其中在线决策必须灵活适应用户偏好的变化(损失函数)以及资源可用性的时间不可预测性(约束)。针对这种损失函数难以建模的人机回环系统,我们开发了一族 bandit 在线鞍点 (BanSaP) 方案,该方案能够根据损失函数的(可能多重)bandit feedback 及变化的环境自适应地调整在线操作。此处性能通过以下指标评估:i) 动态 regret,它推广了广泛使用的静态 regret;ii) fit,用于捕捉累积的约束违反量。具体而言,证明若最优动态解随时间缓慢变化,BanSaP 能同时产生次线性动态 regret 和 fit。在雾计算卸载任务中的数值测试证实,与基于梯度 feedback 的现有方法相比,我们提出的 BanSaP 方法具有竞争力的性能。
引用
@article{arxiv.1707.09060,
title = {Bandit Convex Optimization for Scalable and Dynamic IoT Management},
author = {Tianyi Chen and Georgios B. Giannakis},
journal= {arXiv preprint arXiv:1707.09060},
year = {2018}
}