乐观线性支撑与后继特征作为最优策略迁移的基
分布式、并行与集群计算
2022-12-23 v2
摘要
在许多现实应用中,强化学习(RL)智能体可能必须解决多个任务,每个任务通常通过一个奖励函数建模。如果奖励函数以线性方式表达,且智能体先前已学习到一组针对不同任务的策略,则可利用后继特征(SFs)组合这些策略并为新问题识别合理的解。然而,所识别的解无法保证最优。我们引入一种解决该局限的新算法。它允许 RL 智能体组合已有策略并直接识别任意新问题的最优策略,无需与环境进行任何进一步交互。我们首先证明(在温和假设下)SFs 所处理的迁移学习问题等价于 RL 中学习优化多目标的问题。随后我们引入乐观线性支撑(Optimistic Linear Support)算法的基于 SF 的扩展,以学习一组其 SFs 构成凸覆盖集的策略。我们证明该集合中的策略可通过广义策略改进进行组合,为任意新的线性可表达任务构建最优行为,而无需任何额外训练样本。我们在经验上表明,在值函数近似下,我们的方法在离散和连续域均优于最先进的竞争算法。
引用
@article{arxiv.2206.11328,
title = {Federated Deep Reinforcement Learning for Open RAN Slicing in 6G Networks},
author = {Amine Abouaomar and Afaf Taik and Abderrahime Filali and Soumaya Cherkaoui},
journal= {arXiv preprint arXiv:2206.11328},
year = {2022}
}