多智能体强化学习的张量网络实现
机器学习
2024-01-09 v1 多智能体系统
摘要
近期研究表明,张量网络(TNs)能够表示单智能体有限马尔可夫决策过程(FMDP)的期望回报。该张量网络表示一个分布模型,其中考虑了所有可能的轨迹。当将这些思想扩展到多智能体场景时,分布模型会遭遇维度灾难:可能轨迹的数量与智能体数量之间呈指数关系。在此场景下使用张量网络的关键优势在于,存在大量针对张量网络特有的既定优化与分解技术,可应用这些技术来确保找到最高效的表示。本报告利用这些方法构建了一个表示多智能体强化学习(MARL)任务期望回报的张量网络。随后将该模型应用于一个双智能体随机游走示例,结果表明使用 DMRG 技术能够正确优化策略。最后,我展示了一种精确分解技术的应用,在不损失任何信息的情况下,将张量中的元素数量减少了 97.5%。
引用
@article{arxiv.2401.03896,
title = {A Tensor Network Implementation of Multi Agent Reinforcement Learning},
author = {Sunny Howard},
journal= {arXiv preprint arXiv:2401.03896},
year = {2024}
}
备注
MSc Thesis