探索意味着数据增强:上下文 MDP 中的可达性与泛化
机器学习
2025-05-23 v3 人工智能
摘要
在上下文马尔可夫决策过程(MDP)的零样本策略迁移(ZSPT)设置中,智能体在固定的情境集合上训练,必须推广到新的情境。在最近的工作中,人们已论证并演示,增加探索可以改善这种泛化,通过在训练情境中获得更多状态。在本文中,我们证明获得更多状态确实可以改善泛化,但可能会以降低所学价值函数准确性的方式来实现,这不应该有益于泛化。我们假设并演示,使用探索来增加智能体的覆盖率,同时也提高准确性,能够更好地改善泛化。着眼于此,我们提出了一种方法 Explore-Go,在每个剧集的开始实施一次探索阶段,该方法可与现有的基于 on- 和 off-policy RL 算法结合,显著提高了部分可观测 MDP 中的泛化。我们展示了当 Explore-Go 与几种流行算法结合时,其有效性,在多个环境中都显示出泛化性能的提升。通过这一点,我们希望为实践者提供一种简单修改,可提升其智能体的泛化能力。
引用
@article{arxiv.2410.03565,
title = {Exploration Implies Data Augmentation: Reachability and Generalisation in Contextual MDPs},
author = {Max Weltevrede and Caroline Horsch and Matthijs T. J. Spaan and Wendelin Böhmer},
journal= {arXiv preprint arXiv:2410.03565},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2406.08069