强化学习中模型的组合
机器学习
2026-05-05 v1 人工智能
神经与进化计算
摘要
深度强化学习(DRL)在Atari和围棋等领域取得了优异成绩, 但仍因高采样成本和训练之外的弱迁移而受限. 常见的应对方式是通过迁移、蒸馏、集成方法或联邦训练等机制重用先前训练的模型信息, 以避免从随机初始化学习每个目标任务. 该领域文献碎片化, 已发表的比较难以解释, 因为任务、基准和计算预算不同. 本文采用PRISMA指导的系统性综述, 对经济学习中预训练知识重用的实证研究进行系统评估. 从IEEE Xplore、ACM Digital Library和引用追踪中检索的589条记录中, 我们筛选出570个唯一记录并评估了89篇完整文献. 在应用最终合格性标准后, 15项实证研究 remain 在主综述中. 我们对其进行定性分析, 考量三个因素: 来源-目标相似性、重用模型间的多样性以及对从头开始基准的公平比较. 这三个模式在存活的语料中反复出现. 首先, 正面结果集中在源和目标任务共享大量结构或方法包括显式门控或对齐机制的情况中. 其次, 对于集成和联邦聚合的证据虽有希望但稀疏, 且大多局限于狭窄环境. 第三, 计算匹配的比较极少, 这削弱了关于相对于更强单智能体基准的效率收益的论点. 本文贡献了更窄且内部一致的综述范围、研究层面的实证证据综述, 以及一个暂定的独立性谱系, 该谱系应被视为未来基准测试的假设而非已验证的指标.
引用
@article{arxiv.2605.02159,
title = {Combining Trained Models in Reinforcement Learning},
author = {Ujjwal Patil and Javad Ghofrani},
journal= {arXiv preprint arXiv:2605.02159},
year = {2026}
}
备注
6 pages, 2 figures, 3 tables; Literature Review, Hochschule Bonn-Rhein-Sieg