中文

基于自博弈深度强化学习的含不完全信息复杂真实世界移动网络从仿真到真实的优化

人工智能 2018-12-07 v3 机器学习 机器学习

摘要

每天数百万人使用的移动网络是世界上最复杂的系统之一。优化移动网络以满足爆炸式增长的客户需求并降低资本/运营支出带来了巨大挑战。尽管近期取得进展,鉴于真实世界中的数据稀缺、部分可观测性、风险与复杂规则/动力学,以及仿真与真实世界间的巨大现实差距,深度强化学习(DRL)在复杂真实世界问题上的应用仍悬而未决。为弥合现实差距,我们引入了一种Sim-to-Real框架,通过图卷积神经网络(CNN)——将部分可观测的移动网络抽象为图,再将域变的不规则图提炼为局部欧几里得空间中的域不变张量作为CNN输入——、域随机化和多任务学习,直接将学习从仿真迁移到真实世界。我们采用一种新颖的自博弈机制,通过模拟退火鼓励DRL智能体在多项任务上以最佳记录相互竞争,正如运动员在十项全能中竞争世界纪录。我们还提出了一种去中心化多智能体、竞争与协作的DRL方法,以协调多小区的动作,最大化全局奖励并最小化对邻小区的负面影响。通过在商用移动网络上的6次现场试验,我们首次证明DRL智能体可在无需真实世界任何训练的情况下,成功将学习从仿真迁移到具有不完全信息、复杂规则/动力学、巨大状态/动作空间和多智能体交互的复杂真实世界问题。

关键词

引用

@article{arxiv.1802.06416,
  title  = {Sim-to-Real Optimization of Complex Real World Mobile Network with Imperfect Information via Deep Reinforcement Learning from Self-play},
  author = {Yongxi Tan and Jin Yang and Xin Chen and Qitao Song and Yunjun Chen and Zhangxiang Ye and Zhenqiang Su},
  journal= {arXiv preprint arXiv:1802.06416},
  year   = {2018}
}

备注

Accepted by NIPS 2018 Workshop