面向任务型对话系统的预算受限策略学习
计算与语言
2019-06-04 v1 人工智能
机器学习
神经与进化计算
摘要
本文提出一种新方法,通过引入预算感知调度(Budget-Conscious Scheduling, BCS)扩展Deep Dyna-Q (DDQ),以在固定且少量的用户交互(预算)下最优地学习任务型对话智能体。BCS包含:(1) 基于泊松过程的全局调度器,在不同训练阶段分配预算;(2) 控制器,在每步训练时决定智能体使用真实还是模拟经验进行训练;(3) 用户目标采样模块,生成对策略学习最有效的经验。在电影票预订任务上利用模拟与真实用户进行的实验表明,在给定固定预算下,我们的方法相较最先进的基线在成功率上取得了显著提升。
引用
@article{arxiv.1906.00499,
title = {Budgeted Policy Learning for Task-Oriented Dialogue Systems},
author = {Zhirui Zhang and Xiujun Li and Jianfeng Gao and Enhong Chen},
journal= {arXiv preprint arXiv:1906.00499},
year = {2019}
}
备注
10 pages, 7 figures, ACL 2019