中文

TSN-Affinity:用于持续离线强化学习的相似性驱动参数复用

机器学习 2026-04-29 v1 人工智能

摘要

持续离线强化学习(CORL)旨在从随时间收集的数据集中学习一系列任务,同时保持对先前学习任务的性能。此设定对应于新任务随时间出现,但在实时环境交互中调整模型成本高昂、风险大或不可能的领域。然而,CORL 继承了离线强化学习的双重困难,以及在防止灾难性遗忘的同时进行适应的困难。基于回放的持续学习方法仍然是一个强大的基线,但会产生内存开销,并且回放样本与新学习的策略之间存在分布不匹配。同时,架构持续学习方法在监督学习中显示出强大潜力,但在 CORL 中仍未被充分探索。在这项工作中,我们提出了 TSN-Affinity,一种基于 TinySubNetworks 和 Decision Transformer 的新型 CORL 方法。该方法通过一种强化学习感知的复用策略实现任务特定参数化和受控知识共享,该策略根据动作兼容性和潜在相似性路由任务。我们在基于 Atari 游戏和 Franka Emika Panda 机械臂操作任务仿真的基准上评估了该方法,涵盖了离散和连续控制。结果显示稀疏子网络具有强大的保留能力,路由进一步提高了多任务性能。我们的发现表明,在 CORL 设定中,相似性引导的架构复用是基于回放策略的强大且可行的替代方案。我们的代码可在以下地址获取:https://github.com/anonymized-for-submission123/tsn-affinity。

关键词

引用

@article{arxiv.2604.25898,
  title  = {TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning},
  author = {Dominik Żurek and Kamil Faber and Marcin Pietron and Paweł Gajewski and Roberto Corizzo},
  journal= {arXiv preprint arXiv:2604.25898},
  year   = {2026}
}