使用离线强化学习的通知多目标优化
机器学习
2022-07-08 v1 机器学习
摘要
移动通知系统在各类应用中扮演着重要角色,用于通信、向用户发送提醒和警报,告知他们新闻、事件或消息。本文将准实时通知决策问题形式化为一个马尔可夫决策过程,在奖励中优化多个目标。我们提出一个端到端的离线强化学习框架,以优化序列通知决策。我们采用基于保守 Q 学习的双深度 Q 网络方法来应对离线学习的挑战,该方法缓解了分布偏移问题和 Q 值高估问题。我们展示了完全部署的系统,并通过离线和在线实验证明了所提方法的性能与优势。
引用
@article{arxiv.2207.03029,
title = {Multi-objective Optimization of Notifications Using Offline Reinforcement Learning},
author = {Prakruthi Prabhakar and Yiping Yuan and Guangyu Yang and Wensheng Sun and Ajith Muralidharan},
journal= {arXiv preprint arXiv:2207.03029},
year = {2022}
}
备注
9 pages, 6 figures, to be published in KDD 22'