基于深度神经网络学习转移模型的可扩展规划
人工智能
2020-07-16 v5 机器学习
摘要
在诸如水库控制、暖通空调和导航领域等许多具有因子化、混合离散与连续状态与动作空间的实际规划问题中,难以获得支配状态演化的复杂非线性动力学模型。然而,现代传感器的普及使我们能够从这些复杂系统中收集大量数据,并构建其状态转移的高精度非线性深度神经网络模型。但对于控制任务仍存在一大问题——我们如何能够利用深度网络学习的转移模型进行规划,而无需诉诸蒙特卡洛树搜索及其他忽略模型结构且不易扩展到混合离散与连续领域的黑盒转移模型技术?本文引入两类可利用深度神经网络学习转移模型的非线性规划方法:混合深度 MILP 规划器(HD-MILP-Plan)与 Tensorflow 规划器(TF-Plan)。在 HD-MILP-Plan 中,我们提出关键观察:深度网络的修正线性单元(ReLU)传递函数不仅加快模型学习的收敛,还允许将深度网络转移模型直接编译为混合整数线性规划(Mixed-Integer Linear Program)编码。此外,我们确定了针对 HD-MILP-Plan 的深度网络特定优化,其相较基础编码提升了性能,并表明我们可以针对所学深度网络进行最优规划。在 TF-Plan 中,我们利用自动微分工具与基于 GPU 的计算效率,将一类纯连续规划问题编码为循环神经网络,并通过反向传播直接优化动作。我们比较了两种规划器,表明 TF-Plan 能够在更少计算时间内逼近 HD-MILP-Plan 所找到的最优规划……
引用
@article{arxiv.1904.02873,
title = {Scalable Planning with Deep Neural Network Learned Transition Models},
author = {Ga Wu and Buser Say and Scott Sanner},
journal= {arXiv preprint arXiv:1904.02873},
year = {2020}
}
备注
36 pages