双DQN与Dueling DQN 在跨环境迁移下的控制性研究
机器学习
2026-02-12 v2 人工智能
摘要
在深度强化学习中,迁移学习常以改善稳定性和降低训练成本为动机,但在显著的域迁移情况下可能失败。本文present了一项受控实证研究,探讨了双Deep Q网络(DDQN)与Dueling DQN之间的架构差异如何影响跨环境中的迁移行为。使用CartPole作为源任务,选用结构上截然不同的LunarLander作为目标任务,我们评估了一个在相同超参数和训练条件下进行的固定层级表示迁移协议,并使用从头训练的基线智能体来语境化理解迁移效应。实证结果表明,DDQN在所检验的 setup下始终能够避免负迁移,并在目标环境中维持与基线性能相当的学习动力学。相比之下,Dueling DQN在相同条件下始终表现出负迁移,表现为奖励下降和不稳定的优化行为。跨多个随机种子的统计分析确认了迁移下的显著性能差距。这一发现表明,架构的归纳偏差与在价值型深度强化学习中针对所检验的迁移协议的跨环境鲁棒性密切相关。
引用
@article{arxiv.2602.09810,
title = {A Controlled Study of Double DQN and Dueling DQN Under Cross-Environment Transfer},
author = {Azkaa Nasir and Fatima Dossa and Muhammad Ahmed Atif and Mohammad Shahid Shaikh},
journal= {arXiv preprint arXiv:2602.09810},
year = {2026}
}