慈善捐赠调查实验中的情境_bandit:实验内结果对比策略学习
计量经济学
2022-11-23 v1 机器学习
机器学习
摘要
我们设计并实施了一项自适应实验(一种“情境_bandit”)以学习定向处理分配策略,其目标是利用参与者的调查响应来决定在捐赠劝募中向其展示哪家慈善机构。该设计平衡了两个相互竞争的目标:优化实验受试者的结果(“累积遗憾最小化”)与收集对策略学习最有益的数据,即学习一种若在实验后使用可最大化福利的分配规则(“简单遗憾最小化”)。我们通过收集试点数据并进行仿真研究来评估替代实验设计。接下来,我们实现了所选算法。最后,我们开展了以收集数据为基础的第二次仿真研究,评估所选算法的益处。我们的第一个结果是,在此设定下,当数据通过均匀随机化收集而非通过标准累积遗憾最小化或策略学习算法自适应收集时,所学策略的价值更高。我们提出了一种用于自适应实验的简单启发式方法,从策略学习视角改善了均匀随机化,代价是相对于替代 bandit 算法增加了累积遗憾。该启发式方法通过以下方式修改现有的情境_bandit 算法:(i) 对分配概率施加缓慢衰减的下界,使得没有臂被过快丢弃;(ii) 在自适应收集数据后,将策略学习限制于已收集充足数据的臂中选择。
引用
@article{arxiv.2211.12004,
title = {Contextual Bandits in a Survey Experiment on Charitable Giving: Within-Experiment Outcomes versus Policy Learning},
author = {Susan Athey and Undral Byambadalai and Vitor Hadad and Sanath Kumar Krishnamurthy and Weiwen Leung and Joseph Jay Williams},
journal= {arXiv preprint arXiv:2211.12004},
year = {2022}
}