能否将深度 RL 策略权重视为轨迹建模来优化?
机器学习
2025-03-07 v1 人工智能
神经与进化计算
摘要
从随机网络初始化中学习最优策略是深度强化学习(RL)的核心主题。随着 DRL 训练规模的扩大,将 DRL 策略网络权重视为一种新的数据模态并探索其潜力变得具有吸引力和可行性。在这项工作中,我们聚焦于深度 RL 中的策略学习路径,将其表示为历史策略的网络权重轨迹,该轨迹反映了策略学习过程的演化。借鉴轨迹建模与 Transformer 的思想,我们提出了 Transformer as Implicit Policy Learner (TIPL),以自回归方式处理策略网络权重。我们通过运行独立的 RL 训练试验收集策略学习路径数据,并利用这些数据训练 TIPL 模型。在实验中,我们证明了 TIPL 能够拟合策略学习的隐式动力学,并通过推断完成策略网络的优化。
引用
@article{arxiv.2503.04074,
title = {Can We Optimize Deep RL Policy Weights as Trajectory Modeling?},
author = {Hongyao Tang},
journal= {arXiv preprint arXiv:2503.04074},
year = {2025}
}
备注
Accepted as an extended abstract to ICLR 2025 Workshop on Weight Space Learning (WSL)