面向多种关注结果的政策学习:将最优政策树与多目标贝叶斯优化相结合
机器学习
2023-10-18 v2 人工智能
计量经济学
摘要
学习最优政策的方法利用因果机器学习模型来创建人类可解释的规则,以围绕不同政策干预的分配做出选择。然而,在现实的政策制定情境中,决策者往往关注结果之间的权衡,而非仅仅单一地最大化某一结果的效用。本文提出一种称为多目标政策学习(MOPoL)的方法,该方法将用于政策学习的最优决策树与多目标贝叶斯优化方法相结合,以探索多个结果之间的权衡。其通过构建针对不同超参数设置(控制结果权重)的非支配模型的帕累托前沿来实现这一点。此处的关键在于,就决策目的而言,低成本的贪心树可作为计算代价极高的优化树的准确代理,这意味着可重复拟合模型以学习帕累托前沿。该方法应用于肯尼亚抗疟药物非价格配给的真实案例研究。
引用
@article{arxiv.2212.06312,
title = {Policy learning for many outcomes of interest: Combining optimal policy trees with multi-objective Bayesian optimisation},
author = {Patrick Rehill and Nicholas Biddle},
journal= {arXiv preprint arXiv:2212.06312},
year = {2023}
}
备注
24 pages, 7 figures