未知环境中可行策略的在线学习
最优化与控制
2016-04-08 v1 动力系统
摘要
将一个环境定义为随时间任意变化的凸约束函数集,并考虑一个同样为凸且任意变化的代价函数。在该环境中运行的代理(agents)意图选择在所有时刻可行的动作,同时最小化代价的时平均。如果代价和环境先验已知,则此动作是最优的并可离线计算。在线策略是一种因果依赖于代价和环境的策略。为比较在线策略与最优离线动作,将一条轨迹的可行度(fit)定义为随时间积分约束违反的向量,将其遗憾(regret)定义为与最优动作随时间累积的代价差。可行度衡量在线策略在学习可行动作方面的成功程度,而遗憾衡量其学习最优动作的成功程度。本文提出使用由鞍点控制器计算的在线策略,其可行度和遗憾被证明要么有界,要么以次线性速率增长。这些性质表明该控制器找到了在松弛意义下可行且最优的轨迹。文中始终以一名牧羊人想要靠近羊群中所有羊的问题为例说明概念。数值实验表明鞍点控制器使牧羊人能够做到这一点。
引用
@article{arxiv.1604.02137,
title = {Online Learning of Feasible Strategies in Unknown Environments},
author = {Santiago Paternain and Alejandro Ribeiro},
journal= {arXiv preprint arXiv:1604.02137},
year = {2016}
}