中文

基于少量训练情境的强化学习零样本情境泛化

机器学习 2025-12-30 v2

摘要

深度强化学习(DRL)已在多个领域取得显著成就,包括竞技游戏、自然语言处理和机器人等。尽管如此,DRL训练的策略常常难以泛化到具有不同参数的评估环境。这一挑战通常通过在多个情境下训练和/或利用问题中额外的结构来解决。然而,在实际应用中获取跨多样化情境的充足训练数据往往不切实际。在本工作中,我们考虑具有在情境参数上 exhibiting regularity 的情境马尔可夫决策过程(CMDP),其中包含状态转移和奖励函数。我们引入情境增强巴尔金方程(CEBE),以提高在单一情境下训练时的泛化能力。我们在分析上和实验上证明,CEBE是训练于多个情境的Q函数的一次函数近似。随后,我们推导出情境样本增强(CSE)作为确定性控制环境中近似CEBE的有效数据增强方法。我们在仿真环境中对CSE的性能进行了数值验证,展示了其在DRL中提升泛化能力的潜力。

关键词

引用

@article{arxiv.2507.07348,
  title  = {Zero-Shot Context Generalization in Reinforcement Learning from Few Training Contexts},
  author = {James Chapman and Kedar Karhadkar and Guido Montufar},
  journal= {arXiv preprint arXiv:2507.07348},
  year   = {2025}
}

备注

10 pages, 8 figures, 3 tables, publushed at Neurips 2025