中文

基于分层深度强化学习的复合任务完成对话策略学习

计算与语言 2017-07-25 v3 人工智能 机器学习

摘要

构建能够完成复杂任务(例如旅行规划)的对话智能体具有挑战性,因为该智能体必须学会协同完成多个子任务。例如,智能体需要预订酒店并预订航班,以便在到达和酒店入住之间留有足够的通勤时间。本文通过将任务表述为马尔可夫决策过程(MDPs)上选项的数学框架,并提出一种分层深度强化学习方法来学习在不同时间尺度上运行的对话管理器,以应对这一挑战。该对话管理器包括:(1) 一个在子任务或选项之间进行选择的高层对话策略,(2) 一个选择基本动作以完成由高层策略给出的子任务的低层对话策略,以及 (3) 一个全局状态跟踪器,有助于确保所有跨子任务的约束得到满足。在带有模拟和真实用户的旅行规划任务上的实验表明,我们的方法相对于三个基线取得了显著改进,其中两个基于手工规则,另一个基于扁平深度强化学习。

关键词

引用

@article{arxiv.1704.03084,
  title  = {Composite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning},
  author = {Baolin Peng and Xiujun Li and Lihong Li and Jianfeng Gao and Asli Celikyilmaz and Sungjin Lee and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:1704.03084},
  year   = {2017}
}

备注

12 pages, 8 figures