中文

基于 Tensorflow 的混合非线性域可扩展规划

机器学习 2017-11-07 v3

摘要

鉴于近期深度学习结果表明,利用 GPU 上的梯度下降优化能够有效优化高维非凸函数,我们在本文中探讨:诸如 Tensorflow 这样的符号梯度优化工具,是否能够有效用于具有高分状态与动作空间的混合(离散与连续混合)非线性域中的规划?为此,我们证明了基于 Tensorflow 和 RMSProp 梯度下降的混合规划,在与分段线性规划域(我们能够计算最优解)上基于混合整数线性规划(MILP)的优化相比时具有竞争力,并且在非线性规划域上大幅优于最先进的内点法。此外,我们注意到 Tensorflow 具有高度可扩展性,在一个大规模并发域上,总共 576,000 个连续动作参数分布在 96 个时间步长和 100 个并行实例上,仅在 4 分钟内就收敛到一个强规划。我们提供了一些见解以阐明如此强劲的性能,包括观察到尽管时间跨度长,RMSProp 避免了梯度消失和梯度爆炸问题。这些结果共同表明,通过利用 GPU 和诸如 Tensorflow 等高度优化工具包中梯度下降的最新进展,为非线性混合域中的高度可扩展规划开辟了新的前沿。

关键词

引用

@article{arxiv.1704.07511,
  title  = {Scalable Planning with Tensorflow for Hybrid Nonlinear Domains},
  author = {Ga Wu and Buser Say and Scott Sanner},
  journal= {arXiv preprint arXiv:1704.07511},
  year   = {2017}
}

备注

9 pages