通过动作嵌入的强化学习实现多领域对话策略
计算与语言
2022-07-04 v1 机器学习
摘要
通过强化学习学习任务型对话策略通常需要大量与用户的交互,这在实践中使此类方法无法用于真实应用。为降低数据需求,我们提议利用来自不同对话领域的数据,从而减少每个给定领域所需的数据量。具体而言,我们提议学习领域无关的动作嵌入,其捕捉通用结构以在给定当前对话上下文时告知系统如何行动,随后被特化到特定领域。我们展示了该方法能够以显著更少的用户交互进行学习,所需对话数量减少 35%,并且在一组模拟领域上达到比为每个领域单独训练策略更高的熟练度。
引用
@article{arxiv.2207.00468,
title = {Reinforcement Learning of Multi-Domain Dialog Policies Via Action Embeddings},
author = {Jorge A. Mendez and Alborz Geramifard and Mohammad Ghavamzadeh and Bing Liu},
journal= {arXiv preprint arXiv:2207.00468},
year = {2022}
}
备注
Presented in the Conversational AI Workshop, NeurIPS 2019