多目标竞争强化学习的可证明高效算法
机器学习
2021-02-08 v1
摘要
我们研究多目标强化学习(RL),其中智能体的奖励表示为一个向量。在智能体与对手竞争的设置中,其性能由平均回报向量到目标集的距离来衡量。我们开发了统计和计算高效的算法来逼近相应的目标集。我们的结果将 Blackwell 可逼近性定理(Blackwell, 1956)推广到表格 RL,其中策略性探索变得至关重要。所提出的算法是自适应的;即使没有 Blackwell 可逼近性条件,其保证也成立。如果对手使用固定策略,我们给出了逼近目标集的改进速率,同时也解决了同时最小化标量代价函数这一更宏大的目标。我们通过将结果与先前关于约束 RL 的工作相联系,讨论了这一特殊情况的分析。据我们所知,本工作提供了首个针对向量值马尔可夫博弈的可证明高效算法,且我们的理论保证是近最优的。
引用
@article{arxiv.2102.03192,
title = {Provably Efficient Algorithms for Multi-Objective Competitive RL},
author = {Tiancheng Yu and Yi Tian and Jingzhao Zhang and Suvrit Sra},
journal= {arXiv preprint arXiv:2102.03192},
year = {2021}
}