中文

学习激励信息获取:恰当评分规则遇上委托-代理模型

机器学习 2023-08-08 v2 人工智能 计算机科学与博弈论 理论经济学 机器学习

摘要

我们研究激励式信息获取问题,其中委托人雇佣代理人代表其收集信息。该问题被建模为委托人与代理人之间的斯塔克伯格博弈:委托人宣布规定支付的评分规则,随后代理人选择使其自身利润最大化并报告信息的努力水平。我们从委托人的角度研究该问题的在线设定,即通过反复与策略性代理人交互来设计最优评分规则。我们设计了一种可证明样本高效的算法,该算法将 UCB 算法(Auer 等人,2002)适配于我们的模型,并在 TT 次迭代后达到亚线性 T2/3T^{2/3} 后悔界。我们的算法具有对委托人最优利润的精细估计过程,以及确保激励出期望代理人行为的保守修正方案。此外,我们后悔界的一个关键特征是其独立于环境状态的数量。

关键词

引用

@article{arxiv.2303.08613,
  title  = {Learning to Incentivize Information Acquisition: Proper Scoring Rules Meet Principal-Agent Model},
  author = {Siyu Chen and Jibang Wu and Yifan Wu and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2303.08613},
  year   = {2023}
}

备注

35 pages, adding an impossible result (Lemma 3.2) with its proof in Section D.1