中文

通过基于 A3C 强化学习的对话代理改进搜索

人工智能 2018-08-21 v2

摘要

我们开发了一个基于强化学习的搜索助手,它可以通过一系列动作和交互序列来协助用户实现其意图。我们的方法适用于主观搜索,即用户寻找图像等数字资产,这与具有客观且有限搜索模态的任务有根本不同。在此类搜索任务中,通常没有可用的带标注对话数据,而通过人工交互训练代理可能非常耗时。我们提出了一种随机虚拟用户,它模拟真实用户,可用于高效采样用户行为以训练代理,从而加速代理的自举过程。我们开发了基于 A3C 算法的上下文保持架构,使代理能够向用户提供上下文辅助。我们将 A3C 代理与 Q-learning 进行了比较,并在验证回合中评估了其从虚拟用户处获得的平均奖励和状态值。我们的实验表明,该代理学会了获得更高的奖励和更好的状态。

关键词

引用

@article{arxiv.1709.05638,
  title  = {Improving Search through A3C Reinforcement Learning based Conversational Agent},
  author = {Milan Aggarwal and Aarushi Arora and Shagun Sodhani and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:1709.05638},
  year   = {2018}
}

备注

17 pages, 7 figures