中文

消解目标条件强化学习中涌现探索机制的奥秘

机器学习 2025-10-17 v1

摘要

本工作迈出了阐明无监督强化学习中涌现探索机制第一步。我们研究单目标对比强化学习(SGCRL),这是一种无需外部奖励或课程即可解决具有挑战性长期目标到达任务的自监督算法。我们结合对算法目标函数的理论分析与受控实验,以了解其探索驱动机制。我们表明,SGCRL最大化由其学习表示所塑造的隐式奖励。这些表示自动修改奖励景观,以在到达目标前促进探索,并在之后促进利用。我们的实验还表明,这些探索动力学源于对状态空间的低秩表示,而非来自神经网络函数逼近。我们获得的改进理解使我们能够调整SGCRL以执行安全感知的探索。

关键词

引用

@article{arxiv.2510.14129,
  title  = {Demystifying the Mechanisms Behind Emergent Exploration in Goal-conditioned RL},
  author = {Mahsa Bastankhah and Grace Liu and Dilip Arumugam and Thomas L. Griffiths and Benjamin Eysenbach},
  journal= {arXiv preprint arXiv:2510.14129},
  year   = {2025}
}