受约束的多任务强化学习中的自然策略梯度与演员-评论家方法
最优化与控制
2024-05-07 v1 机器学习
摘要
多任务强化学习(RL)旨在寻找一个有效解决多个任务的单一策略。本文提出了一种受约束的多任务RL formulation,其目标是在每个任务性能受限的前提下,最大化策略在各任务上的平均性能。我们在集中式设置下(即单个服务器可获取所有任务信息)和分散式设置下(即由负责单个任务的代理人网络组成,彼此通过本地通信合作)求解该问题。我们首先提出一种原-对偶算法,在精确梯度评估下可证明收敛至该受约束 formulation 的全局最优解。当梯度未知时,我们进一步发展了基于抽样的演员-评论家算法,通过在线抽样状态、动作和奖励找到最优策略。最后,我们研究了该算法在线性函数逼近设置下的扩展。
引用
@article{arxiv.2405.02456,
title = {Natural Policy Gradient and Actor Critic Methods for Constrained Multi-Task Reinforcement Learning},
author = {Sihan Zeng and Thinh T. Doan and Justin Romberg},
journal= {arXiv preprint arXiv:2405.02456},
year = {2024}
}