中文

PerSim:基于个性化模拟器的异质智能体数据高效离线强化学习

机器学习 2021-11-11 v4

摘要

我们考虑在严重数据稀缺下的异质智能体离线强化学习(RL),即我们仅在未知且可能次优的策略下观测到每个智能体的单条历史轨迹。我们发现,鉴于如此有限的数据可用性,最先进的离线与基于模型的RL方法的性能显著下降,即便对于通常被认为已“解决”的基准设置如“MountainCar”与“CartPole”也是如此。为应对此挑战,我们提出PerSim,一种基于模型的离线RL方法,其首先通过集体使用所有智能体的历史轨迹来为每个智能体学习一个个性化模拟器,然后再学习策略。我们通过假设跨智能体的转移动态可表示为与智能体、状态及动作相关的潜因子的潜函数来实现这一点;随后,我们从理论上确立该函数可由可分离的智能体、状态与动作潜函数的“低秩”分解良好近似。该表示提示了一种简单、正则化的神经网络架构,即便在稀缺的离线数据下也能有效学习每个智能体的转移动态。我们在若干基准环境与RL方法上进行了广泛实验。我们的方法在状态动态预测与最终奖励两方面度量下的一致改进,证实了我们的框架在利用有限历史数据同时学习跨智能体个性化策略上的有效性。

关键词

引用

@article{arxiv.2102.06961,
  title  = {PerSim: Data-Efficient Offline Reinforcement Learning with Heterogeneous Agents via Personalized Simulators},
  author = {Anish Agarwal and Abdullah Alomar and Varkey Alumootil and Devavrat Shah and Dennis Shen and Zhi Xu and Cindy Yang},
  journal= {arXiv preprint arXiv:2102.06961},
  year   = {2021}
}