在线委托-代理交互中的学习:策略菜单的威力
计算机科学与博弈论
2024-01-01 v2 机器学习
摘要
我们研究了在线委托-代理问题中普遍存在的学习挑战,在此过程中,委托人从历史交互中代理人的显示偏好里学习其私人信息。该范式包括重要的特例,如定价和合同设计,这些在近期文献中已被广泛研究。然而,现有工作考虑的是委托人在每一轮只能选择单一策略与代理人交互,然后通过其行动观察代理人显示偏好的情形。在本文中,我们将这一研究线扩展为允许委托人向代理人提供策略菜单,并额外从观察代理人在菜单中的选择中进行学习。我们对几种在线委托-代理问题设置进行了全面调查,并表征了它们的样本复杂度,同时提供了我们开发的相应算法。我们将该范式实例化到几个重要的设计问题中——包括 Stackelberg(安全)博弈、合同设计和信息设计。最后,我们还探索了我们的发现与关于 Stackelberg 博弈中在线学习的现有结果之间的联系,并提供了一个能够克服 Peng 等人(2019)的一个关键困难实例的解决方案。
引用
@article{arxiv.2312.09869,
title = {Learning in Online Principal-Agent Interactions: The Power of Menus},
author = {Minbiao Han and Michael Albert and Haifeng Xu},
journal= {arXiv preprint arXiv:2312.09869},
year = {2024}
}
备注
AAAI Conference on Artificial Intelligence (AAAI 2024)