支持口腔自我护理的在线强化学习算法的奖励设计
人工智能
2022-09-15 v3 机器学习
摘要
尽管牙病在很大程度上是可预防的,但它仍是最常见的慢性疾病之一。然而,患者常常遗忘或放弃有关最佳口腔卫生习惯的专业建议。因此,及时且个性化的鼓励以帮助患者参与口腔自我护理行为,可能使患者受益。在本文中,我们开发了一种在线强化学习(RL)算法,用于优化基于移动端的提示推送,以鼓励口腔卫生行为。开发此类算法的主要挑战之一是确保算法考虑当前动作对未来动作有效性的影响(即延迟效应),尤其是在为使算法能在受限的真实环境(即高度噪声、稀疏数据)中稳定自主运行而将其简化时。我们通过设计一种质量奖励来应对这一挑战,该奖励在最大化期望健康结果(即高质量刷牙)的同时最小化用户负担。我们还强调了一种通过构建仿真环境测试平台并利用该平台评估候选方案来优化奖励超参数的流程。本文讨论的RL算法将被部署在Oralytics中,这是一个通过提供行为策略来提升患者参与口腔卫生实践的应用程序。
引用
@article{arxiv.2208.07406,
title = {Reward Design For An Online Reinforcement Learning Algorithm Supporting Oral Self-Care},
author = {Anna L. Trella and Kelly W. Zhang and Inbal Nahum-Shani and Vivek Shetty and Finale Doshi-Velez and Susan A. Murphy},
journal= {arXiv preprint arXiv:2208.07406},
year = {2022}
}