中文

2048:延迟奖励环境中的强化学习

机器学习 2025-07-28 v2 人工智能

摘要

延迟和稀疏奖励是强化学习 (RL) 代理面临的根本性障碍,这些代理在其收益延迟数千步后难以对动作进行信用归因。2048 这一滑动拼图游戏恰恉体现了这一挑战:尽管频繁的小得分变化提供即时反馈,但常导致代理陷入局部最优但全局次优的策略。本文引入一种统一的分布式多步 RL 框架,以直接优化长期绩效。使用开源 Gym-2048 环境,我们开发并比较了四种智能体变体:标准 DQN、PPO、QR-DQN(分位回归 DQN)以及一种集成分布式学习、双臂架构、噪声网络、优先级经验回放等技术的新型 Horizon-DQN (H-DQN)。经验评估揭示了有效性的明确等级:最大 episode 分数从 DQN 的 3.988K 提升至 PPO 的 5.756K、QR-DQN 的 8.66K 以及 H-DQN 的 18.21K,其中 H-DQN 成功达到 2048 砖块。扩展 H-DQN 后,其最大得分达 41.828K,4096 砖块也实现。这些结果表明,分布式、多步目标在稀疏奖励领域显著提升了性能,并为通过模型基准规划和课程学习实现进一步提升提供了可前景的路径。

关键词

引用

@article{arxiv.2507.05465,
  title  = {2048: Reinforcement Learning in a Delayed Reward Environment},
  author = {Prady Saligram and Tanvir Bhathal and Robby Manihani},
  journal= {arXiv preprint arXiv:2507.05465},
  year   = {2025}
}

备注

We found an issue with our result aggregation scripts: some evaluation logs were incomplete and others duplicated, causing incorrect numbers in tables and figures. Because these graphs and tables underpin key comparisons, we are withdrawing the paper to regenerate verified results