新型动作下的短期-长期策略评估
机器学习
2024-07-11 v2
摘要
从将大语言模型应用于教育,到识别新药并改进充电电池的方式,创新者不断尝试新的策略,以寻求对学生、患者和消费者更长期后果的更好结果。然而,这一创新循环的一个主要瓶颈是观察包含新干预的决策政策下游影响所需的时间。关键问题是,我们能否在不进行长期观察的情况下快速评估新决策政策的长期结果。组织们常常可获取关于过去决策政策及其结果的数据,这些数据是在感兴趣的完整时间范围内评估的。针对这一问题,我们提出了一种新的序列决策任务设置,用于短期-长期策略评估。我们提出的方法在HIV治疗、肾透析和电池充电等模拟器上显著优于先前结果。我们还演示了这些方法对于AI安全具有用途,通过快速识别新决策政策可能在性能上远低于过去政策的情形。
引用
@article{arxiv.2407.03674,
title = {Short-Long Policy Evaluation with Novel Actions},
author = {Hyunji Alex Nam and Yash Chandak and Emma Brunskill},
journal= {arXiv preprint arXiv:2407.03674},
year = {2024}
}
备注
Added references for related work