未训练策略的探索行为
机器学习
2025-07-28 v3 人工智能
机器学习
摘要
在强化学习 (RL) 中,探索始终是一个根本性挑战,尤其是在稀疏或对抗性奖励结构的环境中。本文研究了深度神经策略的架构如何在训练前隐式地塑造探索。我们理论和实证地演示了从未训练策略生成球形或扩散轨迹的策略。利用无限宽度网络的理论和连续时间限制,我们表明未训练的策略返回相关动作并导致非平凡的状态访问分布。我们讨论了标准架构下相应轨迹的分布,揭示了解决探索问题的归纳偏见。我们的结果建立了使用策略初始化作为设计工具来理解早期训练中探索行为的理论和实验框架。
引用
@article{arxiv.2506.22566,
title = {Exploration Behavior of Untrained Policies},
author = {Jacob Adamczyk},
journal= {arXiv preprint arXiv:2506.22566},
year = {2025}
}
备注
High-dimensional Learning Dynamics Workshop at ICML-2025