驯服潜在变分对话策略中的连续后验分布
计算与语言
2022-06-02 v2 人工智能
机器学习
摘要
在面向任务的对话(ToD)系统中,利用摊销变分推断进行潜在动作强化学习(RL)已被证明是优化对话成功率的有效方法。迄今为止,分类后验分布一直被认为是性能的主要驱动因素之一。在本文中,我们重新审视用于潜在动作 RL 的高斯变分后验分布,并表明它们可以取得比分类后验更好的性能。我们通过简化训练过程来实现这一点,并提出了对潜在对话策略进行正则化以保持良好回复连贯性的方法。使用连续潜在表示,我们的模型在 MultiWOZ 基准上取得了最先进的对话成功率,并且在回复连贯性方面也与分类潜在方法表现相当。
引用
@article{arxiv.2205.07633,
title = {Taming Continuous Posteriors for Latent Variational Dialogue Policies},
author = {Marin Vlastelica and Patrick Ernst and György Szarvas},
journal= {arXiv preprint arXiv:2205.07633},
year = {2022}
}