强化学习课程的热力学学
机器学习
2026-03-16 v1 人工智能
摘要
统计力学与机器学习之间的联系反复证明了具有启发性,为优化、泛化和表示学习提供了见解。在本工作中,我们沿袭这一传统,通过利用非平衡热力学结果来形式化强化学习 (RL) 中的课程学习。在本文中,我们提出了一种几何框架,通过将奖励参数解释为任务流形上的坐标来进行 RL。我们展示,通过最小化剩余热力学功,最优课程对应于该任务空间中的测地线。作为本框架的应用,我们提供了一种算法,“MEW”(Minimum Excess Work),用于推导温度退火在最大熵 RL 中的最佳 schedule。
引用
@article{arxiv.2603.12324,
title = {Thermodynamics of Reinforcement Learning Curricula},
author = {Jacob Adamczyk and Juan Sebastian Rojas and Rahul V. Kulkarni},
journal= {arXiv preprint arXiv:2603.12324},
year = {2026}
}
备注
Accepted at SciForDL Workshop at ICLR 2026