中文

面向任务型对话系统的预算受限策略学习

计算与语言 2019-06-04 v1 人工智能 机器学习 神经与进化计算

摘要

本文提出一种新方法,通过引入预算感知调度(Budget-Conscious Scheduling, BCS)扩展Deep Dyna-Q (DDQ),以在固定且少量的用户交互(预算)下最优地学习任务型对话智能体。BCS包含:(1) 基于泊松过程的全局调度器,在不同训练阶段分配预算;(2) 控制器,在每步训练时决定智能体使用真实还是模拟经验进行训练;(3) 用户目标采样模块,生成对策略学习最有效的经验。在电影票预订任务上利用模拟与真实用户进行的实验表明,在给定固定预算下,我们的方法相较最先进的基线在成功率上取得了显著提升。

关键词

引用

@article{arxiv.1906.00499,
  title  = {Budgeted Policy Learning for Task-Oriented Dialogue Systems},
  author = {Zhirui Zhang and Xiujun Li and Jianfeng Gao and Enhong Chen},
  journal= {arXiv preprint arXiv:1906.00499},
  year   = {2019}
}

备注

10 pages, 7 figures, ACL 2019