中文

提升基于强化学习的列车重调度中的样本效率与多智能体通信

人工智能 2020-04-29 v1 机器学习 多智能体系统

摘要

我们展示了在 Flatland 国际列车重调度竞赛中获得第六名的参赛方案的初步结果,包括两项用于优化强化学习(RL)训练效率的改进,以及关于深度 RL 用于复杂现实世界控制任务前景的两个假设:第一,当前最先进的策略梯度方法似乎不适用于高后果环境领域;第二,学习显式通信动作(可以说是一种新兴的机器对机器语言)可能提供一种补救办法。这些假设需要未来的工作来证实。若得到证实,它们有望用于优化如瑞士联邦铁路路网这类高效物流生态系统。

关键词

引用

@article{arxiv.2004.13439,
  title  = {Improving Sample Efficiency and Multi-Agent Communication in RL-based Train Rescheduling},
  author = {Dano Roost and Ralph Meier and Stephan Huschauer and Erik Nygren and Adrian Egli and Andreas Weiler and Thilo Stadelmann},
  journal= {arXiv preprint arXiv:2004.13439},
  year   = {2020}
}

备注

Accepted for publication at the 7th Swiss Conference on Data Science (SDS 2020)