中文

用于视觉强化学习泛化的显著性不变一致性策略学习

人工智能 2025-02-25 v2

摘要

将策略泛化到未见场景是视觉强化学习中的一个关键挑战,其中智能体常常对训练环境的特定视觉观测过拟合。在未见环境中,分散像素可能导致智能体提取包含任务无关信息的表示。因此,智能体可能偏离训练期间学到的最优行为,从而阻碍视觉泛化。为了解决这一问题,我们提出了显著性不变一致性策略学习(SCPL)算法,一个用于零样本泛化的高效框架。我们的方法引入了一个新颖的价值一致性模块和一个动力学模块,以有效捕捉任务相关表示。价值一致性模块由显著性引导,确保智能体在原始和扰动观测中都关注任务相关像素,而动力学模块使用增强数据帮助编码器捕捉动态和奖励相关表示。此外,我们的理论分析强调了策略一致性对泛化的重要性。为加强这一点,我们引入了一个带有KL散度约束的策略一致性模块,以在原始和扰动观测之间保持一致的策略。在DMC-GB、机器人操作和CARLA基准上的广泛实验表明,SCPL在泛化方面显著优于最先进的方法。特别值得注意的是,SCPL在具有挑战性的DMC视频硬设置、机器人硬设置和CARLA基准中分别实现了平均14%、39%和69%的性能提升。项目页面:https://sites.google.com/view/scpl-rl。

关键词

引用

@article{arxiv.2502.08336,
  title  = {Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning},
  author = {Jingbo Sun and Songjun Tu and Qichao Zhang and Ke Chen and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2502.08336},
  year   = {2025}
}