好动作成功,坏的动作泛化:基于强化学习泛化能力的案例研究
机器学习
2025-03-21 v1
摘要
监督学习(Supervised Learning, SL)和强化学习(Reinforcement Learning, RL)都是广泛用于训练复杂任务通用智能体的技术,但它们的泛化能力及其背后的机制尚未完全得到理解。本文提供了在零样本泛化方面进行的直接比较。我们以 Habitat 视觉导航任务为测试平台,评估了在两个层次上的 PPO 和行为克隆(Behavior Cloning, BC)智能体:一种是同一场景内的状态-目标对泛化,另一种是对未见环境的泛化。我们的实验表明,PPO 在两种零样本设置以及成功率和 SPL 指标上均一致优于 BC。有趣的是,尽管额外的优化训练数据使 BC 能够在 SPL 上匹配 PPO 的零样本性能,但在成功率方面仍显著落后。我们将其归因于这些算法训练的模型在泛化方式上的根本差异:BC 训练的模型通过模仿成功轨迹来实现泛化,而基于 TD 的 RL 训练的模型则通过组合经验拼接来实现泛化——利用大量过去轨迹的碎片(主要是失败的轨迹)来构建对新任务的解决方案。这使得 RL 能够高效地在庞大的状态空间中找到解决方案,并发现超出人类知识范围的新策略。除了提供实证证据和理解外,我们还提出了通过算法设计提高 RL 和 SL 泛化能力的实用指南。
引用
@article{arxiv.2503.15693,
title = {Good Actions Succeed, Bad Actions Generalize: A Case Study on Why RL Generalizes Better},
author = {Meng Song},
journal= {arXiv preprint arXiv:2503.15693},
year = {2025}
}