中文

用于深度强化学习中知识迁移与快速启动的值函数初始化

人工智能 2025-08-14 v1 机器学习 计算机科学中的逻辑

摘要

值函数初始化(VFI)是一种通过利用来自先前任务的值估计在强化学习(RL)中实现快速启动的有效方法。虽然这种方法在表格型设置中已得到充分确立,但由于状态-动作空间的连续性、神经网络的噪声近似以及存储所有过去模型以供重用的不切实际性,将其扩展到深度强化学习(DRL)带来了挑战。在这项工作中,我们解决了这些挑战,并引入了 DQInit,一种将值函数初始化适配到 DRL 的方法。DQInit 重用从先前已解决任务中提取的紧凑表格 Q 值作为可迁移知识库。它采用基于已知度的机制,将这些迁移值软集成到探索不足的区域中,并逐渐向智能体学习到的估计值转移,避免了固定时间衰减的局限性。我们的方法通过仅依赖值估计而非策略或演示,为 DRL 中的知识迁移提供了一种新视角,有效地结合了快速启动 RL 和策略蒸馏的优势,同时减轻了它们的缺点。在多个连续控制任务上的实验表明,与标准初始化和现有迁移技术相比,DQInit 持续提高了早期学习效率、稳定性和整体性能。

关键词

引用

@article{arxiv.2508.09277,
  title  = {Value Function Initialization for Knowledge Transfer and Jump-start in Deep Reinforcement Learning},
  author = {Soumia Mehimeh},
  journal= {arXiv preprint arXiv:2508.09277},
  year   = {2025}
}