中文

想象超越!面向在线强化学习的分布鲁棒自编码器以实现状态空间覆盖

机器学习 2025-11-05 v3 人工智能

摘要

目标导向强化学习(Goal-Conditioned Reinforcement Learning, GCRL)使智能体能够自主获取多样化行为,但在视觉环境中面临主要挑战,由于高维、语义稀疏的观测。在在线环境中,智能体在探索的同时学习表征,随着策略的演进而演化其潜在空间,以捕捉新发现的环境区域。然而,若没有激励机制最大化表示中的状态覆盖,基于自编码器的经典方法可能收敛于过度代表智能体频繁访问的受限状态集合的潜在空间。这在内在动机环境中尤为严重,在此情况下,智能体使用潜在空间中编码的分布来采样其学习掌握的目标。为此,我们提出逐步强制分布向完整状态空间上的均匀分布发生偏移,以确保可学习技能的全覆盖。我们引入DRAG(面向GCRL的分布鲁棒自编码器,Distributionally Robust Auto-Encoding for GCRL),该方法将β-变分自编码器框架与分布鲁棒优化相结合。DRAG利用对VAE训练状态的对抗性神经加权器,以考虑当前数据分布与环境不可见部分之间的不匹配。这使智能体能够构建其即时经验之外的语义意义上的潜在空间。我们的方法在包含迷宫和涉及墙体绕行的机器人控制等硬探索环境中实现了状态空间覆盖和下游控制性能的提升,无需预训练或先验环境知识。

关键词

引用

@article{arxiv.2505.17830,
  title  = {Imagine Beyond! Distributionally Robust Auto-Encoding for State Space Coverage in Online Reinforcement Learning},
  author = {Nicolas Castanet and Olivier Sigaud and Sylvain Lamprier},
  journal= {arXiv preprint arXiv:2505.17830},
  year   = {2025}
}