中文

迁移学习中的泛化问题

机器学习 2024-03-06 v2 人工智能 机器人学 机器学习

摘要

利用深度强化学习算法训练的智能体能够执行高度复杂的任务,包括在连续环境中的运动控制。我们研究将在一个任务中获得的学习迁移到一组先前未见的任务上。当前迁移学习研究中较少关注深度强化学习中的泛化与过拟合问题。若不进行中间正则化步骤而开展比较分析,会因粗浅的评估导致基准表现不佳与算法比较不准确。在本研究中,我们通过应用样本剔除、早停以及最大熵正则化对抗学习,提出面向连续控制的深度强化学习正则化技术。首先,将讨论在深度迁移强化学习中将训练迭代次数纳入超参数之列的重要性。由于源任务性能并不能指示算法的泛化能力,我们从承认训练迭代次数作为一个超参数开始。据此,我们引入一个额外步骤,即求助于策略参数的较早快照,以防止对源任务过拟合。然后,为生成鲁棒策略,我们通过一种称为严格裁剪的方法丢弃导致过拟合的样本。此外,我们在广泛使用的迁移学习基准中,通过对抗式设定下使用最大熵正则化、不同评论家方法与课程学习,提升了泛化能力。随后,我们提出最大熵对抗强化学习以增强域随机化。最后,我们在形态、重力与环境切向摩擦系数均被改变的靶标环境中的模拟机器人上评估了这些方法的鲁棒性。

关键词

引用

@article{arxiv.1909.01331,
  title  = {Generalization in Transfer Learning},
  author = {Suzan Ece Ada and Emre Ugur and H. Levent Akin},
  journal= {arXiv preprint arXiv:1909.01331},
  year   = {2024}
}

备注

23 pages, 36 figures