中文

使用自适应分布式强化学习的多目标优化

机器学习 2024-03-19 v1 人工智能 多智能体系统 最优化与控制

摘要

智能交通系统(Intelligent Transportation System, ITS)环境已知是动态和分布式的,其中参与者(车辆用户、运营商等)具有多个、不断变化且可能相互冲突的目标。尽管强化学习(Reinforcement Learning, RL)算法通常被用于优化资源管理和计算卸载等ITS应用,但大多数RL算法专注于单一目标。在许多情况下,将多目标问题转化为单目标问题是不可能的、难以处理的或不够充分的,这使得此类RL算法不适用。我们提出了一种具有高学习效率和低计算需求的多目标、多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)算法,该算法在具有稀疏和延迟奖励的动态、分布式和嘈杂环境中自动触发自适应少样本学习。我们在具有边缘云计算的ITS环境中测试了我们的算法。实证结果表明,与最先进的基准相比,该算法能快速适应新环境,并在所有个体和系统指标上表现更好。我们的算法还通过其模块化和异步在线训练方法解决了各种实际问题。除了云仿真之外,我们还在单板计算机上测试了我们的算法,并表明它可以在6毫秒内进行推理。

关键词

引用

@article{arxiv.2403.08879,
  title  = {Multi-Objective Optimization Using Adaptive Distributed Reinforcement Learning},
  author = {Jing Tan and Ramin Khalili and Holger Karl},
  journal= {arXiv preprint arXiv:2403.08879},
  year   = {2024}
}