无监督行为压缩:通过状态占有率学习低维策略流形
机器学习
2026-04-03 v2 人工智能
摘要
深度强化学习 (DRL) 被广泛认为是样本效率低,部分原因在于策略参数空间的高维度和 substantial 功能冗余。最近提出的一个框架,即我们称为基于动作的策略压缩 (Action-based Policy Compression, APC),通过利用学习生成映射 将参数空间 压缩到低维潜在流形 ,从而缓解了这一问题。然而,其性能严重受限于依赖立即动作匹配作为重构损失,这种对行为相似性的浅显代理导致在顺序决策中积累误差。为克服这一瓶颈,我们引入基于占有率的策略压缩 (Occupancy-based Policy Compression, OPC),通过将行为表示从立即动作匹配转向长期状态空间覆盖来增强 APC。具体而言,我们提出了两个主要改进:(1) 我们采用信息论唯一性度量来策划数据生成,构建样本多样化的策略群体;(2) 我们提出一种全可微的压缩目标,直接最小化真实占有率分布与重构占有率分布之间的偏差。这些修改迫使生成模型围绕真实功能相似性组织潜在空间,从而促进潜在表示在广泛的行为谱系上具有更好的泛化能力,同时保留了原始参数空间的绝大部分表达能力。最后,我们在多个连续控制基准任务中经验性地验证了我们贡献的优势。
引用
@article{arxiv.2603.27044,
title = {Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching},
author = {Andrea Fraschini and Davide Tenedini and Riccardo Zamboni and Mirco Mutti and Marcello Restelli},
journal= {arXiv preprint arXiv:2603.27044},
year = {2026}
}