标记时间点的深度强化学习
机器学习
2018-11-07 v2 社会与信息网络
机器学习
摘要
在广泛的应用中,人类通过连续时间中的异步随机离散事件与复杂环境交互。我们能否设计在线干预,以在这种异步设定下帮助人类实现特定目标?本文从标记时间点过程的深度强化学习视角解决上述问题,其中智能体采取的行动及其从环境接收的反馈均为使用标记时间点过程刻画的异步随机离散事件。在此过程中,我们利用相应过程的强度与标记分布定义智能体的策略,进而推导出一种灵活的策略梯度方法,该方法使用深度循环神经网络将智能体的行动及其接收的反馈嵌入实值向量。我们的方法不对反馈的强度与标记分布的函数形式作任何假设,且允许任意复杂的奖励函数。我们将方法应用于个性化教学与病毒式营销两种不同场景,并利用从 Duolingo 和 Twitter 收集的数据表明,相比替代方案,它可能找到帮助学习者和营销者更有效实现其目标的干预措施。
引用
@article{arxiv.1805.09360,
title = {Deep Reinforcement Learning of Marked Temporal Point Processes},
author = {Utkarsh Upadhyay and Abir De and Manuel Gomez-Rodriguez},
journal= {arXiv preprint arXiv:1805.09360},
year = {2018}
}
备注
To appear in Proceedings of the 32nd Conference on Neural Information Processing Systems (NIPS 2018)