利用离线强化学习发现最小化学生流失的援助策略
机器学习
2022-02-01 v1
摘要
高等教育中的高辍学率暴露出效率低下,导致期望落空与资金浪费。预测处于风险中的学生不足以避免其辍学。通常,必须为每位学生在恰当时机发现并施以适当的援助行动。为应对这一序贯决策问题,我们提出一种决策支持方法,利用离线强化学习为学生的援助行动选择提供支持,以有效帮助决策者避免学生辍学。此外,我们评估了采用两种不同聚类方法对学生状态空间进行离散化。使用真实学生日志数据的实验通过离策略评估表明,该方法应能获得约为日志策略 1.0 至 1.5 倍的累积奖励。因此,该方法可协助决策者施以适当援助行动,并有可能降低学生辍学率。
引用
@article{arxiv.2104.10258,
title = {Discovering an Aid Policy to Minimize Student Evasion Using Offline Reinforcement Learning},
author = {Leandro M. de Lima and Renato A. Krohling},
journal= {arXiv preprint arXiv:2104.10258},
year = {2022}
}
备注
8 pages, 6 figures, accepted for publication in 2021 International Joint Conference on Neural Networks (IJCNN 2021)