从参数到行为:策略空间的无监督压缩
机器学习
2026-02-25 v2 人工智能
摘要
尽管深度强化学习 (DRL) 最近取得了成功,但其样本效率低下是众所周知的。我们认为,这种低效源于直接在高维且高度冗余的参数空间 中优化策略的标准做法。这一挑战在多任务设置中变得更加严峻。在这项工作中,我们开发了一种新颖的无监督方法,将策略参数空间 压缩为低维潜在空间 。我们通过优化行为重建损失来训练生成模型 ,这确保了潜在空间是按功能相似性而非参数化邻近度来组织的。我们推测,该流形的固有维度是环境复杂性的函数,而非策略网络的大小。我们在连续控制域中验证了我们的方法,表明标准策略网络的参数化可以被压缩高达五个数量级,同时保留大部分表达能力。作为副产品,我们展示了学习到的流形能够通过在潜在空间 中运行的策略梯度实现特定任务的适应。
引用
@article{arxiv.2509.22566,
title = {From Parameters to Behaviors: Unsupervised Compression of the Policy Space},
author = {Davide Tenedini and Riccardo Zamboni and Mirco Mutti and Marcello Restelli},
journal= {arXiv preprint arXiv:2509.22566},
year = {2026}
}
备注
ICLR 2026 camera ready version. Changed typo in the title