多智能体模仿学习:价值容易,遗憾困难
机器学习
2024-06-27 v2
摘要
我们研究了一个多智能体模仿学习(MAIL)问题,从学习者的角度出发,试图基于专家协调一组智能体的演示来协调一组智能体。先前大多数MAIL工作基本上将问题简化为在演示支持范围内匹配专家的行为。虽然这样做足以在假设智能体非策略性的情况下将学习者和专家之间的价值差距降至零,但它不能保证对策略性智能体的偏离具有鲁棒性。直观地说,这是因为策略性偏离可能依赖于一个反事实量:协调者在其推荐所导致的状态分布之外的推荐。为此,我们率先研究了马尔可夫博弈中MAIL的另一种目标,我们称之为遗憾差距,它明确考虑了组内智能体潜在的偏离。我们首先深入探讨了价值差距和遗憾差距之间的关系。首先,我们表明,虽然价值差距可以通过单智能体IL算法的直接扩展有效最小化,但即使价值等价也可能导致任意大的遗憾差距。这意味着在MAIL中实现遗憾等价比实现价值等价更难。然后,我们提供了两种有效的归约到无遗憾在线凸优化的方法,能够在(a)在专家覆盖假设下(MALICE)或(b)在可查询专家(BLADES)的情况下最小化遗憾差距。
引用
@article{arxiv.2406.04219,
title = {Multi-Agent Imitation Learning: Value is Easy, Regret is Hard},
author = {Jingwu Tang and Gokul Swamy and Fei Fang and Zhiwei Steven Wu},
journal= {arXiv preprint arXiv:2406.04219},
year = {2024}
}