中文

元对话策略学习

计算与语言 2020-06-05 v1 机器学习

摘要

对话策略决定智能体的下一步动作,因此是对话系统的核心。然而,当迁移到数据稀少的全新领域时,策略模型可能因与新环境的交互不足而难以适应。我们提出深度可迁移 Q 网络(DTQN)以利用领域间可共享的低层信号,如对话行为与槽位。我们将状态与动作表示空间分解为对应这些低层组件的特征子空间,以促进跨领域知识迁移。此外,我们将 DTQN 嵌入元学习框架,并引入带有双重回放机制的 Meta-DTQN,以实现高效的离策略训练与适应。在实验中,我们的模型在多领域对话数据集 MultiWOZ 2.0 上的成功率与对话效率均优于基线模型。

关键词

引用

@article{arxiv.2006.02588,
  title  = {Meta Dialogue Policy Learning},
  author = {Yumo Xu and Chenguang Zhu and Baolin Peng and Michael Zeng},
  journal= {arXiv preprint arXiv:2006.02588},
  year   = {2020}
}

备注

10 pages, 3 figures