基于外部知识和两阶段Q函数的强化学习预测热门Reddit帖子
计算与语言
2017-04-21 v1
摘要
本文利用强化学习解决在线讨论论坛中评论流行度预测问题,特别针对自然语言状态和动作空间带来的两个挑战。首先,将表征特定时刻讨论中跟踪的评论历史的状态表示进行增强,以纳入外部知识源中可用的世界事件讨论所代表的全局上下文。其次,引入了两阶段Q学习框架,使得在考虑子动作间冗余的同时搜索组合动作空间成为可能。我们在五个Reddit社区上进行实验,表明这两种方法均优于该任务上先前报告的结果。
引用
@article{arxiv.1704.06217,
title = {Reinforcement Learning with External Knowledge and Two-Stage Q-functions for Predicting Popular Reddit Threads},
author = {Ji He and Mari Ostendorf and Xiaodong He},
journal= {arXiv preprint arXiv:1704.06217},
year = {2017}
}