中文

具有未观测智能体奖励与完美知识智能体的重复委托-代理博弈

机器学习 2023-05-09 v2 人工智能 计算机科学与博弈论 机器学习

摘要

受医疗健康和可持续交通等领域众多实际应用的启发,本文在多臂老虎机 (MAB) 框架下研究重复委托-代理博弈场景,其中:委托人对每个老虎机臂给予不同激励,代理人选择一个老虎机臂以最大化其自身期望奖励加激励,委托人观测所选臂并因该臂获得奖励(不同于代理人的奖励)。为委托人设计策略具有挑战性,因为委托人无法直接观测代理人对其所选动作的奖励,因此无法利用现有估计技术直接学习期望奖励。因此,为该场景及类似场景设计策略的问题在很大程度上仍未被探索。本文针对代理人对各老虎机臂自身期望奖励具有完美知识的情形,构建了一种在该场景下实现低后悔值(即直至对数因子的平方根后悔)的策略。我们通过首先构建代理人各老虎机臂期望奖励的估计器来设计策略。由于我们的估计器以所提供的激励序列及随后所选臂为数据,委托人的估计可视为 MAB 中在线逆优化的类比。接下来我们构建了一种策略,通过推导估计器的有限样本集中界证明其实现低后悔。最后通过数值模拟展示了我们的策略在协同运输规划实际场景中的适用性。

关键词

引用

@article{arxiv.2304.07407,
  title  = {Repeated Principal-Agent Games with Unobserved Agent Rewards and Perfect-Knowledge Agents},
  author = {Ilgin Dogan and Zuo-Jun Max Shen and Anil Aswani},
  journal= {arXiv preprint arXiv:2304.07407},
  year   = {2023}
}

备注

50 pages, 4 figures