中文

用于任务型对话策略学习的对抗优势 actor-critic 模型

计算与语言 2018-02-09 v2 人工智能 机器学习

摘要

本文提出一种新方法——对抗优势 actor-critic(Adversarial A2C),显著提高了任务型对话系统中对话策略学习的效率。受生成对抗网络(GAN)启发,我们训练一个判别器来区分对话智能体生成的响应/动作与专家给出的响应/动作。然后,我们将该判别器作为另一个评论家引入优势 actor-critic(A2C)框架,以鼓励对话智能体在智能体所采取动作与专家动作相似的区域内探索状态-动作。在电影票预订领域的实验结果表明,所提出的 Adversarial A2C 能高效地加速策略探索。

关键词

引用

@article{arxiv.1710.11277,
  title  = {Adversarial Advantage Actor-Critic Model for Task-Completion Dialogue Policy Learning},
  author = {Baolin Peng and Xiujun Li and Jianfeng Gao and Jingjing Liu and Yun-Nung Chen and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:1710.11277},
  year   = {2018}
}

备注

5 pages, 3 figures, ICASSP 2018