中文

面向对话策略学习的带过重复惩罚的自动课程学习

计算与语言 2020-12-29 v1 人工智能

摘要

基于强化学习的对话策略学习因成本高昂,难以应用于真实用户以从零训练对话智能体。用户模拟器为对话智能体随机选取用户目标进行训练,被视为真实用户的可负担替代方案。然而,这种随机采样方法忽视了人类学习规律,使所学对话策略低效且不稳定。我们提出一种新框架——基于自动课程学习的深度 Q 网络(ACL-DQN),其以教师策略模型替代传统随机采样方法,实现对话策略的自动课程学习。教师模型安排有意义的有序课程,并通过监控对话智能体的学习进度与过重复惩罚自动调整课程,无需任何先验知识。对话智能体的学习进度反映了其能力与所采样目标难度间的关系,以提升采样效率。过重复惩罚保证了采样的多样性。实验表明,ACL-DQN 以统计显著优势提升了对话任务的有效性与稳定性。此外,该框架可通过配备不同课程调度进一步改进,证明其具有强泛化性。

关键词

引用

@article{arxiv.2012.14072,
  title  = {Automatic Curriculum Learning With Over-repetition Penalty for Dialogue Policy Learning},
  author = {Yangyang Zhao and Zhenyu Wang and Zhenhua Huang},
  journal= {arXiv preprint arXiv:2012.14072},
  year   = {2020}
}