中文

在多智能体环境中通过预测其他学习者行为以最大化效用

计算机科学与博弈论 2024-07-09 v1 机器学习 多智能体系统

摘要

学习算法常被用于在序贯决策环境中进行决策。在多智能体环境中,每个智能体的决策会影响其他智能体的效用/损失。因此,如果某个智能体善于预测其他智能体的行为,特别是它们如何根据迄今为止的经验在每一轮中做出决策,它就可以尝试在交互的各轮中明智地做出自己的决策,从而影响其他智能体的行为,最终使自身效用受益。本文研究重复双人博弈,涉及两类智能体:学习者,采用在线学习算法在每轮中选择其策略;优化者,了解学习者的效用函数和在线学习算法。优化者希望在考虑学习者行为的同时进行前瞻规划,以最大化自身效用。我们提供了两个结果:针对重复零和博弈的正面结果和针对重复一般和博弈的负面结果。我们的正面结果是针对优化者的算法,当学习者采用复制器动力学(即乘法权重更新(MWU)的连续时间类比)时,该算法能精确最大化其效用。此外,我们利用该结果为优化者提供了针对 MWU 的算法,即针对离散时间设定,保证优化者获得的平均效用高于单次博弈的值。我们的负面结果表明,除非 P=NP,否则不存在全多项式时间近似方案(FPTAS)来最大化优化者面对每轮对历史采取最优响应的学习者时的效用。然而,是否存在多项式时间算法将效用优化至 o(T)o(T) 的问题仍然悬而未决。

关键词

引用

@article{arxiv.2407.04889,
  title  = {Maximizing utility in multi-agent environments by anticipating the behavior of other learners},
  author = {Angelos Assos and Yuval Dagan and Constantinos Daskalakis},
  journal= {arXiv preprint arXiv:2407.04889},
  year   = {2024}
}