无休止多臂老虎机中可扩展的决策聚焦学习及其在母婴健康中的应用
机器学习
2023-08-15 v4 人工智能
摘要
本文研究具有未知臂转移动态但已知相关臂特征的无休止多臂老虎机(RMAB)问题。目标是学习一个给定特征预测转移动态的模型,其中 Whittle 指数策略利用预测转移求解 RMAB 问题。然而,先前工作通常通过学习最大化预测精度而非最终 RMAB 解质量来训练模型,导致训练与评估目标之间的不匹配。为弥补这一不足,我们提出一种用于 RMAB 中决策聚焦学习的新型方法,直接训练预测模型以最大化 Whittle 指数解质量。我们提出三项关键贡献:(i)我们建立了 Whittle 指数策略的可微性以支持决策聚焦学习;(ii)我们显著提升了序列问题(具体而言 RMAB 问题)中决策聚焦学习方法的可扩展性;(iii)我们将算法应用于先前收集的母婴健康数据集以展示其性能。事实上,我们的算法是首个可扩展至真实世界问题规模的 RMAB 决策聚焦学习算法。
引用
@article{arxiv.2202.00916,
title = {Scalable Decision-Focused Learning in Restless Multi-Armed Bandits with Application to Maternal and Child Health},
author = {Kai Wang and Shresth Verma and Aditya Mate and Sanket Shah and Aparna Taneja and Neha Madhiwalla and Aparna Hegde and Milind Tambe},
journal= {arXiv preprint arXiv:2202.00916},
year = {2023}
}