学习激励信息获取:恰当评分规则遇上委托-代理模型
机器学习
2023-08-08 v2 人工智能
计算机科学与博弈论
理论经济学
机器学习
摘要
我们研究激励式信息获取问题,其中委托人雇佣代理人代表其收集信息。该问题被建模为委托人与代理人之间的斯塔克伯格博弈:委托人宣布规定支付的评分规则,随后代理人选择使其自身利润最大化并报告信息的努力水平。我们从委托人的角度研究该问题的在线设定,即通过反复与策略性代理人交互来设计最优评分规则。我们设计了一种可证明样本高效的算法,该算法将 UCB 算法(Auer 等人,2002)适配于我们的模型,并在 次迭代后达到亚线性 后悔界。我们的算法具有对委托人最优利润的精细估计过程,以及确保激励出期望代理人行为的保守修正方案。此外,我们后悔界的一个关键特征是其独立于环境状态的数量。
引用
@article{arxiv.2303.08613,
title = {Learning to Incentivize Information Acquisition: Proper Scoring Rules Meet Principal-Agent Model},
author = {Siyu Chen and Jibang Wu and Yifan Wu and Zhuoran Yang},
journal= {arXiv preprint arXiv:2303.08613},
year = {2023}
}
备注
35 pages, adding an impossible result (Lemma 3.2) with its proof in Section D.1