动态环境中仿射最大化机制的自动设计
计算机科学与博弈论
2025-02-18 v2
摘要
动态机制设计是普通机制设计的一个具有挑战性的扩展,在此扩展中,机制设计者必须在面对参与智能体可能不真实报告的情况下,随时间推移做出一系列决策。针对福利优化动态机制的研究已相对成熟。然而,针对其他目标(例如收益)的优化研究较少,并且在对估值的限制性假设缺失的情况下,刻画优良机制极具挑战性。相反,我们转向自动机制设计,以在特定问题实例中寻找性能良好的机制。事实上,即使在静态机制设计中情况也类似。然而,在静态情形下,基于优化/机器学习的自动机制设计技术已在超出解析结果适用范围的案例中成功找到了高收益机制。我们将仿射最大化机制类扩展到智能体可能不真实报告其奖励的 MDP 中。这种扩展导致了一个极具挑战性的双层优化问题,其中上层问题涉及选择最优机制参数,下层问题涉及求解由此产生的 MDP。我们的方法能够找到在福利以外的目标上表现优异的真实动态机制,并且基本上可应用于任何能够通过 RL 学习最优策略的问题环境,且对估值没有限制。
引用
@article{arxiv.2402.08129,
title = {Automated Design of Affine Maximizer Mechanisms in Dynamic Settings},
author = {Michael Curry and Vinzenz Thoma and Darshan Chakrabarti and Stephen McAleer and Christian Kroer and Tuomas Sandholm and Niao He and Sven Seuken},
journal= {arXiv preprint arXiv:2402.08129},
year = {2025}
}
备注
Published at the Thirty-Eighth Proceedings of the AAAI Conference on Artificial Intelligence 2024