缩小 TD 学习与监督学习之间的差距——从泛化的视角
机器学习
2024-03-13 v2
摘要
某些强化学习 (RL) 算法能够拼接经验片段,以解决训练期间从未见过的任务。这种备受追捧的特性是基于动态规划的 RL 方法区别于基于监督学习 (SL) 的 RL 方法的少数方式之一。然而,某些基于现成 SL 算法的 RL 方法在没有明确拼接机制的情况下取得了优异的结果;这些方法是否放弃了这一重要的拼接特性仍不清楚。本文针对实现目标状态和实现目标回报值的问题研究了这一疑问。我们的主要结果是表明,拼接特性对应于一种组合泛化形式:在 (状态, 目标) 对的分布上进行训练后,人们希望对训练数据中未同时出现的 (状态, 目标) 对进行评估。我们的分析表明,这种泛化不同于独立同分布 (i.i.d.) 泛化。拼接与泛化之间的这种联系揭示了为什么我们不应期望基于 SL 的 RL 方法执行拼接,即使在大型数据集和模型的极限情况下也是如此。基于此分析,我们构建了新的数据集以明确测试此特性,揭示基于 SL 的方法缺乏这种拼接特性,因此无法执行组合泛化。尽管如此,拼接与组合泛化之间的联系也为改进 SL 中的泛化提供了一种简单的补救措施:数据增强。我们提出了一种时间数据增强,并证明将其添加到基于 SL 的方法中能够使它们成功完成训练期间未同时出现的任务。在更高层次上,这种联系说明了组合泛化对于时间序列数据中数据效率的重要性,这种重要性超越了 RL,延伸至音频、视频或文本等任务。
引用
@article{arxiv.2401.11237,
title = {Closing the Gap between TD Learning and Supervised Learning -- A Generalisation Point of View},
author = {Raj Ghugare and Matthieu Geist and Glen Berseth and Benjamin Eysenbach},
journal= {arXiv preprint arXiv:2401.11237},
year = {2024}
}
备注
ICLR 2024, Project code: https://github.com/RajGhugare19/stitching-is-combinatorial-generalisation