中文

针对具有隐藏奖励且知识不完备智能体的估计与激励

机器学习 2023-08-15 v1 人工智能 计算机科学与博弈论 机器学习

摘要

在实践中,激励提供方(即委托人)通常无法观测受激励智能体(即代理人)的奖励实现情况,这与以往研究的许多委托-代理模型不同。这种信息不对称使得委托人仅能通过观测代理人的决策来一致地估计其未知奖励,而当代理人自身也需学习其奖励时,该问题更具挑战性。这一复杂设定可见于从可再生能源存储合约到个性化医疗激励等多种现实场景,因此不仅具有理论意义,也具备广泛的实际价值。本文探讨了一个自利学习型代理人与学习型委托人之间的重复逆向选择博弈。代理人通过多臂老虎机(MAB)问题最大化其期望奖励与激励之和。在代理人学习的同时,委托人训练一个并行算法,并在一致估计代理人未知奖励与通过提供自适应激励引导代理人以最大化自身效用之间面临权衡。针对非参数模型,我们引入一个仅以委托人激励历史与代理人选择历史为输入的估计器,并将该估计器与所提数据驱动激励策略在 MAB 框架内结合。在不限制代理人算法类型的前提下,我们考虑代理人施加的序贯外部性,证明了估计器的有限样本一致性及委托人的严格后悔界。最后,仿真实验强化了理论结果,验证了我们的框架在绿色能源聚合商合约中的适用性。

关键词

引用

@article{arxiv.2308.06717,
  title  = {Estimating and Incentivizing Imperfect-Knowledge Agents with Hidden Rewards},
  author = {Ilgin Dogan and Zuo-Jun Max Shen and Anil Aswani},
  journal= {arXiv preprint arXiv:2308.06717},
  year   = {2023}
}

备注

72 pages, 6 figures. arXiv admin note: text overlap with arXiv:2304.07407