中文

是否要切换?离线强化学习中的平衡策略切换

机器学习 2025-02-28 v2 信息论 机器学习 math.IT

摘要

强化学习(RL)——寻找最大化收集的长期累积奖励的 optimal 行为(也称为策略)——是机器学习中最具影响力的方法之一,已成功应用于大量场景。然而,在多个决策问题中,面临着策略切换——从当前策略切换到新策略——的可能性,这会产生显著的成本,且在决策时仅限于使用历史数据,无法进行进一步的在线交互。尽管这种离线学习场景不可避免地重要,但我们所知,几乎没有研究努力以灵活且原则的方式平衡切换的收益与成本。借助最优传输领域的思想,我们系统地研究了离线 RL 中的策略切换。我们建立了基本性质,设计了一种 Net Actor-Critic 算法,用于该新颖的切换公式。数值实验在多个机器人控制基准(Gymnasium)和来自 SUMO-RL 的交通灯控制任务上,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2407.01837,
  title  = {To Switch or Not to Switch? Balanced Policy Switching in Offline Reinforcement Learning},
  author = {Tao Ma and Xuzhi Yang and Zoltan Szabo},
  journal= {arXiv preprint arXiv:2407.01837},
  year   = {2025}
}