使用柔和代理函数预测长期顺序策略价值
人工智能
2025-02-04 v2 机器学习
摘要
离策略策略评估(OPE)利用来自不同策略收集的历史数据来估计新策略的结果。然而,现有OPE方法无法处理新策略引入新动作的情况。这一问题在实际领域常见,例如在医疗保健领域,因新药和治疗方法不断开发而产生。新动作需要采集策略数据,但若结果需耗时较长才能观察(例如多年临床试验),则采集策略数据会非常费用高昂。这引出一个关键问题:仅通过观察其短期效应,如何预测策略的长期结果?虽然在一般情况下此问题难以可行,但在某些替代条件下,可将短期策略数据与长期历史数据组合,准确预测新策略的长期价值。在两个模拟的医疗领域——HIV和脓毒症管理中,我们展示我们的估计器仅通过观察10%的完整时域数据即可对新策略的长期价值提供准确的预测。我们还对我们的双鲁棒估计器进行有限样本分析。
引用
@article{arxiv.2412.20638,
title = {Predicting Long Term Sequential Policy Value Using Softer Surrogates},
author = {Hyunji Nam and Allen Nie and Ge Gao and Vasilis Syrgkanis and Emma Brunskill},
journal= {arXiv preprint arXiv:2412.20638},
year = {2025}
}
备注
24 pages, 1 figure