中文

用户想要什么?基于信息增益的分层对话策略优化

机器学习 2021-09-16 v1 计算与语言

摘要

面向任务的对话系统的对话管理组件通常通过强化学习(RL)进行优化。通过 RL 进行优化极易受样本效率低和不稳定的影响。称为封建对话管理(Feudal Dialogue Management)的分层方法通过分解动作空间向更高效的学习迈出了一步。然而,由于仅在对话结束时提供奖励,它仍然受到不稳定性的困扰。我们提出使用基于信息增益的内在奖励来解决此问题。我们提出的奖励倾向于在必要时解决不确定性或查询用户的动作。它使策略能够学习如何高效地检索用户需求,这是每个面向任务的对话中不可或缺的方面。我们称为 FeudalGain 的算法在 PyDial 框架的大多数环境中取得了最先进(SOTA)的结果,优于复杂得多的其他方法。我们通过仿真实验和人工试验证实了算法的样本效率与稳定性。

关键词

引用

@article{arxiv.2109.07129,
  title  = {What Does The User Want? Information Gain for Hierarchical Dialogue Policy Optimisation},
  author = {Christian Geishauser and Songbo Hu and Hsien-chin Lin and Nurul Lubis and Michael Heck and Shutong Feng and Carel van Niekerk and Milica Gašić},
  journal= {arXiv preprint arXiv:2109.07129},
  year   = {2021}
}