中文

深度Q网络神经网络结构搜索的集成方法

机器学习 2025-10-24 v1

摘要

深度强化学习代理的性能在根本上受限于其神经网络结构,这种选择传统上通过昂贵的超参数搜索实现,然后在整个训练期间固定。本工作探讨了在线、自适应的结构优化是否能够超越这一约束并实现更佳的静态设计。我们引入NAS-DQN,将所学习的神经网络结构搜索控制器直接集成到DRL训练循环中,实现基于累计绩效反馈的动态网络重新配置。我们将NAS-DQN在连续控制任务上评估,并对比三个固定结构基线和随机搜索控制,实验覆盖多个随机种子。我们的结果表明,NAS-DQN在最终性能、样本效率和策略稳定性方面均优于基线,同时带来几乎可忽略的计算开销。关键的是,所学取的搜索策略显著优于无向的随机结构探索和劣质固定设计,表明智能、以绩效为导向的搜索是成功的关键机制。这一发现确立了结构调整不仅有益而且是实现在线深度强化学习最优样本效率的必要条件,表明RL代理的设计不必是静态的离线选择,而可以无缝地集成为学习过程本身的动态组件。

关键词

引用

@article{arxiv.2510.19872,
  title  = {An Integrated Approach to Neural Architecture Search for Deep Q-Networks},
  author = {Iman Rahmani and Saman Yazdannik and Morteza Tayefi and Jafar Roshanian},
  journal= {arXiv preprint arXiv:2510.19872},
  year   = {2025}
}