中文

为数字干预设计强化学习算法:实施前指南

机器学习 2022-09-01 v3 人工智能

摘要

在线强化学习(RL)算法正越来越多地用于移动健康和在线教育领域的数字干预个性化。在这些场景中设计和测试 RL 算法的常见挑战包括:确保 RL 算法能在实时约束下稳定学习和运行,以及考虑环境的复杂性,例如缺乏准确的用户动态机制模型。为指引如何应对这些挑战,我们将 PCS(可预测性、可计算性、稳定性)框架——一个融合了监督学习中机器学习与统计学最佳实践的数据科学框架(Yu and Kumbier, 2020)——扩展至数字干预场景下的 RL 算法设计。此外,我们提供了关于如何设计仿真环境的指南,这是利用 PCS 框架评估候选 RL 算法的关键工具。我们以 Oralytics 为例说明了 PCS 框架的设计应用,Oralytics 是一项移动健康研究,旨在通过个性化推送干预消息改善用户的刷牙行为。Oralytics 将于 2022 年底投入实地运行。

关键词

引用

@article{arxiv.2206.03944,
  title  = {Designing Reinforcement Learning Algorithms for Digital Interventions: Pre-implementation Guidelines},
  author = {Anna L. Trella and Kelly W. Zhang and Inbal Nahum-Shani and Vivek Shetty and Finale Doshi-Velez and Susan A. Murphy},
  journal= {arXiv preprint arXiv:2206.03944},
  year   = {2022}
}