面向动态资源约束物联网的自适应预算多臂老虎机
机器学习
2026-03-26 v2 人工智能
网络与互联网体系结构
摘要
物联网(IoT)系统越来越多地运行在设备必须实时响应并管理波动的资源约束(包括能量和带宽)的环境中。然而,当前方法在处理操作约束随时间演变的场景时往往力不从心。为解决这些局限性,我们提出一个专为具有动态操作限制的物联网应用而设计的新型预算多臂老虎机框架。我们的模型引入了一个衰减的违规预算,允许在学习过程早期出现有限的约束违规,并随时间推移逐步强制执行更严格的合规性。我们提出了预算上置信界(Budgeted UCB)算法,该算法能自适应地平衡性能优化与对时变约束的遵守。我们提供了理论保证,证明预算 UCB 在学习周期内实现了次线性遗憾和对数级别的约束违规。在无线通信环境中的大量仿真表明,与标准的在线学习方法相比,我们的方法实现了更快的适应和更好的约束满足。这些结果凸显了该框架在构建自适应、资源感知的物联网系统方面的潜力。
引用
@article{arxiv.2505.02640,
title = {Adaptive Budgeted Multi-Armed Bandits for IoT with Dynamic Resource Constraints},
author = {Shubham Vaishnav and Praveen Kumar Donta and Sindri Magnússon},
journal= {arXiv preprint arXiv:2505.02640},
year = {2026}
}