中文

可证明地基于上下文的连续控制

机器学习 2019-10-31 v1 最优化与控制 机器学习

摘要

人工智能的一个根本挑战是构建能泛化并适应未见环境的智能体。一种常见策略是构建一个解码器,以未见新环境的上下文为输入并相应生成策略。本文研究如何为基本的连续控制任务——线性二次调节器(LQR)构建解码器,LQR可建模广泛真实物理环境。我们提出该问题的简单算法,利用上置信界(UCB)精炼解码器估计并平衡探索-利用权衡。理论上,我们的算法在在线设定下享有O~(T)\widetilde{O}\left(\sqrt{T}\right)后悔界,其中TT为智能体经历的环境数。这也意味着在经历O~(1/ϵ2)\widetilde{O}\left(1/\epsilon^2\right)个环境后,智能体能迁移所学知以获得未见环境的ϵ\epsilon-次优策略。据我们所知,这是连续控制设定下首个可证明高效的解码器构建算法。尽管我们主要关注理论,也呈现了展示算法有效性的实验。

关键词

引用

@article{arxiv.1910.13614,
  title  = {Continuous Control with Contexts, Provably},
  author = {Simon S. Du and Ruosong Wang and Mengdi Wang and Lin F. Yang},
  journal= {arXiv preprint arXiv:1910.13614},
  year   = {2019}
}