中文

通过技能多样性进行技能学习在强化学习中实现可辨识表示

机器学习 2025-07-22 v1 人工智能 机器学习

摘要

自监督特征学习和预训练方法在强化学习(RL)中常依赖于信息论原则,称为互信息技能学习(MISL)。这些方法旨在学习环境的表示,同时也激励探索。然而,表示和互信息参数化在MISL中的作用尚未得到很好的理论理解。我们的工作通过关注对比成功特征(CSF)方法,围绕可辨识表示学习来研究MISL。我们证明了CSF能够通过特征的内积参数化以及技能在判别意义上的多样性,能够可provable地恢复环境的真实特征,最多经历一次线性变换。这项保证了强化学习中表示学习的第一次可辨识性,同时也帮助解释了不同互信息目标的含义以及熵正则化器的缺点。我们在 MuJoCo 和 DeepMind Control 上进行了实验,展示了CSF确实能从状态和像素中可provable地恢复真实特征。

关键词

引用

@article{arxiv.2507.14748,
  title  = {Skill Learning via Policy Diversity Yields Identifiable Representations for Reinforcement Learning},
  author = {Patrik Reizinger and Bálint Mucsányi and Siyuan Guo and Benjamin Eysenbach and Bernhard Schölkopf and Wieland Brendel},
  journal= {arXiv preprint arXiv:2507.14748},
  year   = {2025}
}

备注

16 pages, 7 figures