从非线性观测中学习线性二次调节器
机器学习
2020-10-09 v1 最优化与控制
统计理论
机器学习
统计理论
摘要
我们引入一种称为带丰富观测的LQR(即RichLQR)的连续控制新问题设定。在我们的设定中,环境由具有线性动力学与二次代价的低维连续潜状态概括,但智能体操作于高维、非线性观测(如相机图像)之上。为实现样本高效学习,我们假设学习者可访问一类足够灵活以捕捉从观测到潜状态映射的解码器函数(如神经网络)。我们提出一种新算法RichID,其以仅随潜状态空间维数和解码器函数类容量缩放的样本复杂度,学习到RichLQR的近最优策略。RichID是预言机高效的,且仅通过对最小二乘回归预言机的调用来访问解码器类。我们的结果构成了针对系统模型中存在未知非线性及一般函数逼近的连续控制的首个可证明样本复杂度保证。
引用
@article{arxiv.2010.03799,
title = {Learning the Linear Quadratic Regulator from Nonlinear Observations},
author = {Zakaria Mhammedi and Dylan J. Foster and Max Simchowitz and Dipendra Misra and Wen Sun and Akshay Krishnamurthy and Alexander Rakhlin and John Langford},
journal= {arXiv preprint arXiv:2010.03799},
year = {2020}
}
备注
To appear at NeurIPS 2020