通过技能多样性进行技能学习在强化学习中实现可辨识表示
机器学习
2025-07-22 v1 人工智能
机器学习
摘要
自监督特征学习和预训练方法在强化学习(RL)中常依赖于信息论原则,称为互信息技能学习(MISL)。这些方法旨在学习环境的表示,同时也激励探索。然而,表示和互信息参数化在MISL中的作用尚未得到很好的理论理解。我们的工作通过关注对比成功特征(CSF)方法,围绕可辨识表示学习来研究MISL。我们证明了CSF能够通过特征的内积参数化以及技能在判别意义上的多样性,能够可provable地恢复环境的真实特征,最多经历一次线性变换。这项保证了强化学习中表示学习的第一次可辨识性,同时也帮助解释了不同互信息目标的含义以及熵正则化器的缺点。我们在 MuJoCo 和 DeepMind Control 上进行了实验,展示了CSF确实能从状态和像素中可provable地恢复真实特征。
引用
@article{arxiv.2507.14748,
title = {Skill Learning via Policy Diversity Yields Identifiable Representations for Reinforcement Learning},
author = {Patrik Reizinger and Bálint Mucsányi and Siyuan Guo and Benjamin Eysenbach and Bernhard Schölkopf and Wieland Brendel},
journal= {arXiv preprint arXiv:2507.14748},
year = {2025}
}
备注
16 pages, 7 figures