利用上下文多臂老虎机优化华法林给药:一种离线策略学习与评估方法
机器学习
2024-02-20 v1 人工智能
摘要
华法林(Warfarin)是一种抗凝药物,旨在预防和处理与异常血液凝固相关的病症,使其成为全球处方量最大的药物之一。然而,由于个体反应差异,确定合适的剂量仍然具有挑战性,而开具错误的剂量可能导致严重后果。上下文多臂老虎机和强化学习在解决这一问题方面显示出前景。鉴于观察数据的广泛可用性以及医疗决策中的安全顾虑,我们专注于仅使用来自历史策略的观察数据作为演示来推导新策略;我们在上下文多臂老虎机设置中利用离线策略学习和评估来建立最优的个性化给药策略。我们学到的策略超越了这些基线方法,即使在没有基因型输入且演示次优的情况下也是如此,展示了广阔的应用潜力。
引用
@article{arxiv.2402.11123,
title = {Optimizing Warfarin Dosing Using Contextual Bandit: An Offline Policy Learning and Evaluation Method},
author = {Yong Huang and Charles A. Downs and Amir M. Rahmani},
journal= {arXiv preprint arXiv:2402.11123},
year = {2024}
}