中文

社会福祉的自适应最大化

计量经济学 2024-07-30 v2 机器学习 机器学习

摘要

我们考虑重复选择政策以最大化社会福祉的问题。福祉是私人效用与公共收入的加权和。较早的结果为较晚的政策提供信息。效用不可观测,但可间接推断。响应函数通过实验学习得到。我们推导了 regret 的下界,以及 Exp3 算法变体对应的匹配对抗上界。累积 regret 以 T2/3T^{2/3} 的速率增长。这意味着:(i) 福祉最大化比多臂 bandit 问题(有限政策集速率为 T1/2T^{1/2})更困难;(ii) 我们的算法达到了最优速率。对于随机设定,若社会福祉为凹函数,利用二分搜索算法(针对连续政策集)我们可实现 T1/2T^{1/2} 的速率。我们分析了向非线性所得税的扩展,并勾勒了向商品税扩展的轮廓。我们将我们的设定与垄断定价(较易)及双边贸易的价格设定(较难)进行比较。

关键词

引用

@article{arxiv.2310.09597,
  title  = {Adaptive maximization of social welfare},
  author = {Nicolo Cesa-Bianchi and Roberto Colomboni and Maximilian Kasy},
  journal= {arXiv preprint arXiv:2310.09597},
  year   = {2024}
}