中文

基于强化学习的对话管理中一种混合专家方法

计算与语言 2022-06-02 v1 人工智能

摘要

尽管语言模型(LMs)近期取得了进展,但其在对话管理(DM)问题上的应用以及进行丰富对话的能力仍具挑战。我们利用强化学习(RL)开发了一个对话智能体,以避免短视(输出通用话语)并最大化整体用户满意度。大多数现有的RL对话管理方法在词级别训练智能体,因此即便使用中等规模词表,也须应对组合复杂的动作空间。结果,即便以预训练LM热启动,它们也难以产生成功且引人入胜的对话。为解决此问题,我们提出了一种基于RL的DM,采用新颖的混合专家语言模型(MoE-LM),其包含:(i)能够学习对话历史多样语义的LM;(ii)若干能够生成对应特定属性或人格话语的专用LM(或专家);(iii)利用专家生成的话语进行对话规划的基于RL的DM。我们的MoE方法为生成具有不同意图的合理话语提供了更大灵活性,并使RL能专注于对话级DM。我们在开放域对话上与SOTA基线进行比较,并从生成话语的多样性与合理性以及整体DM性能方面证明了其有效性。

关键词

引用

@article{arxiv.2206.00059,
  title  = {A Mixture-of-Expert Approach to RL-based Dialogue Management},
  author = {Yinlam Chow and Aza Tulepbergenov and Ofir Nachum and MoonKyung Ryu and Mohammad Ghavamzadeh and Craig Boutilier},
  journal= {arXiv preprint arXiv:2206.00059},
  year   = {2022}
}