中文

SEMDICE: 通过稳态分布校正估计实现离线策略状态熵最大化

机器学习 2025-12-12 v1

摘要

在强化学习的无监督预训练中,智能体旨在学习一个用于下游任务的先验策略,而不依赖任务特定的奖励函数。我们聚焦于状态熵最大化(SEM),其目标是学习一个最大化状态稳态分布熵的策略。在本文中,我们提出了SEMDICE,一个原则性的离线策略算法,它从任意离线数据集中计算一个SEM策略,直接在稳态分布空间中优化策略。SEMDICE从任意离线数据集中计算单个稳态马尔可夫状态熵最大化策略。实验结果表明,SEMDICE在最大化状态熵方面优于基线算法,并且在基于SEM的无监督RL预训练方法中实现了最佳的下游任务适应效率。

关键词

引用

@article{arxiv.2512.10042,
  title  = {SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation},
  author = {Jongmin Lee and Meiqi Sun and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2512.10042},
  year   = {2025}
}

备注

ICLR 2025