关于序贯激励设计的复杂性
最优化与控制
2020-07-20 v1
摘要
在许多场景中,委托人动态地与代理人交互,并提供一系列激励以使代理人的行为与期望目标一致。本文关注于合成一个激励序列的问题,该序列一旦提供,即使委托人对代理人的内在动机未知,也能诱导出期望的代理人行为。我们将代理人的行为建模为马尔可夫决策过程,将其内在动机表示为属于有限可能奖励函数集合的奖励函数,并将激励视为提供给代理人的额外奖励。我们首先证明行为修正问题(BMP),即合成一个以委托人的最小总代价诱导期望代理人行为的激励序列的问题,是 PSPACE-hard 的。此外,我们证明通过对委托人可用的激励序列施加某些限制,可以获得 BMP 的两个 NP-complete 变体。我们还给出了可能奖励函数集合的一个充分条件,在该条件下 BMP 可通过线性规划求解。最后,我们提出两种算法来计算 BMP 的 NP-complete 变体的全局和局部最优解。
引用
@article{arxiv.2007.08548,
title = {On the Complexity of Sequential Incentive Design},
author = {Yagiz Savas and Vijay Gupta and Ufuk Topcu},
journal= {arXiv preprint arXiv:2007.08548},
year = {2020}
}