Bandit 数据驱动优化
机器学习
2022-01-19 v2 人工智能
计算机与社会
机器学习
摘要
机器学习在非营利和公共部门的应用通常具有数据获取、预测和干预优化的迭代工作流程。机器学习流水线必须克服四个主要痛点才能在这些环境中真正发挥作用:小数据、仅在默认干预下收集的数据、由于沟通差距导致的未建模目标,以及干预的不可预见后果。在本文中,我们引入了 bandit 数据驱动优化,这是第一个解决这些痛点的迭代预测-处方框架。Bandit 数据驱动优化在一个集成框架中结合了在线 bandit 学习和离线预测分析的优势。我们提出了 PROOF,一种用于该框架的新颖算法,并正式证明了它具有无悔性。使用数值模拟,我们表明 PROOF 比现有的基线实现了更优的性能。我们还将 PROOF 应用于食物救援志愿者推荐的详细案例研究中,并表明 PROOF 作为一个框架,在非营利和公共部门应用的真实世界 AI 中,能够很好地处理 ML 模型的复杂性。
引用
@article{arxiv.2008.11707,
title = {Bandit Data-Driven Optimization},
author = {Zheyuan Ryan Shi and Zhiwei Steven Wu and Rayid Ghani and Fei Fang},
journal= {arXiv preprint arXiv:2008.11707},
year = {2022}
}
备注
This is the complete version of the paper. A version of this paper is also published at AAAI-22