加速供应链强化学习中的策略仿真
人工智能
2025-02-18 v2 分布式、并行与集群计算
机器学习
摘要
在某种状态相关策略下仿真动态系统的单条轨迹是策略优化(PO)算法中的核心瓶颈。单次仿真中必须执行的许多本质上串行的策略评估构成了这一瓶颈的主要部分。在将 PO 应用于供应链优化(SCO)问题时,仿真对应供应链一个月的单条样本路径可能需要数小时。我们提出了一种迭代算法来加速策略仿真,称为 Picard Iteration。该方案将策略评估任务仔细地分配给独立的进程。在一次迭代中,任何给定进程仅在其分配的任务上评估策略,同时假设其他任务具有某种“缓存”的评估结果;该缓存在迭代结束时更新。在 GPU 上实现时,该方案允许在单条轨迹上进行批处理策略评估。我们证明,许多 SCO 问题所提供的结构允许在少量迭代中收敛,且与时间跨度无关。我们展示了即使使用单个 GPU,在大规模 SCO 问题上也能实现 400 倍的实际加速,并在其他 RL 环境中展示了其实际有效性。
引用
@article{arxiv.2406.01939,
title = {Speeding up Policy Simulation in Supply Chain RL},
author = {Vivek Farias and Joren Gijsbrechts and Aryan Khojandi and Tianyi Peng and Andrew Zheng},
journal= {arXiv preprint arXiv:2406.01939},
year = {2025}
}