SEMDICE: 通过稳态分布校正估计实现离线策略状态熵最大化
机器学习
2025-12-12 v1
摘要
在强化学习的无监督预训练中,智能体旨在学习一个用于下游任务的先验策略,而不依赖任务特定的奖励函数。我们聚焦于状态熵最大化(SEM),其目标是学习一个最大化状态稳态分布熵的策略。在本文中,我们提出了SEMDICE,一个原则性的离线策略算法,它从任意离线数据集中计算一个SEM策略,直接在稳态分布空间中优化策略。SEMDICE从任意离线数据集中计算单个稳态马尔可夫状态熵最大化策略。实验结果表明,SEMDICE在最大化状态熵方面优于基线算法,并且在基于SEM的无监督RL预训练方法中实现了最佳的下游任务适应效率。
引用
@article{arxiv.2512.10042,
title = {SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation},
author = {Jongmin Lee and Meiqi Sun and Pieter Abbeel},
journal= {arXiv preprint arXiv:2512.10042},
year = {2025}
}
备注
ICLR 2025