中文

学习领导:在黑暗环境中激励战略代理人

机器学习 2025-06-11 v1 计算机科学与博弈论 机器学习

摘要

我们研究了广义代理模型的在线学习版本,其中主体与拥有私有类型、私有奖励且采取不可观测行动的战略代理人进行重复互动。该代理人非心智化,优化折扣未来奖励之和,可能策略性地误报类型以操纵主体的学习。主体仅观察到自己的实现奖励和代理人报告的类型,旨在学习最优协作机制以最小化战略后悔。我们开发了第一个在这一具有挑战性设置下具有可证样本效率的算法。我们的ethods 包括:(i)一种延迟机制以激励近似心智化的代理人行为,(ii)一种创新的奖励角度估计框架,使用行业测试和匹配程序来恢复类型相关的奖励函数,以及(iii)一种悲观-乐观LinUCB算法,使主体能够在尊重代理人激励约束的同时高效探索。我们建立了对于学习主体最优策略的近最优 O~(T)\tilde{O}(\sqrt{T}) 后悔上界,其中 O~()\tilde{O}(\cdot) 省略了对数因子。我们的结果开辟了设计面向广泛涉及私有类型和战略代理人的游戏论设置中鲁棒在线学习算法的新途径。

关键词

引用

@article{arxiv.2506.08438,
  title  = {Learning to Lead: Incentivizing Strategic Agents in the Dark},
  author = {Yuchen Wu and Xinyi Zhong and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2506.08438},
  year   = {2025}
}

备注

81 pages, 7 figures