面向城市的多任务离线强化学习:通过对比数据共享
机器学习
2024-06-21 v1
摘要
在城市环境中增强多样化的人类决策过程是贯穿于各种应用的关键性议题,包括出租车调度、公共交通管理以及自动驾驶。在从预收集的人类生成的时空城市数据中学习和优化人类城市策略(或政策)的离线强化学习(RL)是一种有前景的做法。然而,标准的离线 RL 面临两个显著挑战:(1)数据稀缺与数据异构性,(2)分布迁移。本文引入了 MODA——一种多任务离线强化学习与对比数据共享方法。MODA 通过在任务之间进行对比数据共享,解决了多任务城市环境中数据稀缺和异构性的挑战。该技术通过对比正负数据对来提取人类行为的潜在表征,然后与目标任务共享呈现相似表征的数据,促进每个任务的数据增强。此外,MODA 发展了一种新型基于模型的多任务离线 RL 算法。该算法通过将动态模型与生成对抗网络(GAN)集成,构建鲁棒的马尔可夫决策过程(MDP)。一旦构建了鲁棒的 MDP,即可应用任何在线 RL 或规划算法。在真实世界的多任务城市环境中进行的大量实验验证了 MODA 的有效性。结果表明,MODA 在与最先进基准方法之间展现出显著的改进,展示了其在推动城市决策过程方面的能力。我们也将代码公开于研究社区。
引用
@article{arxiv.2406.14054,
title = {Urban-Focused Multi-Task Offline Reinforcement Learning with Contrastive Data Sharing},
author = {Xinbo Zhao and Yingxue Zhang and Xin Zhang and Yu Yang and Yiqun Xie and Yanhua Li and Jun Luo},
journal= {arXiv preprint arXiv:2406.14054},
year = {2024}
}
备注
KDD 2024