用于持续强化学习的动态对话策略
计算与语言
2022-10-11 v2 机器学习
摘要
持续学习是人类学习的关键组成部分之一,也是人工智能的必要要求。由于对话可能潜在地跨越无限多的主题与任务,任务型对话系统必须具备持续学习的能力,在动态适应新挑战的同时保留已获取的知识。尽管十分重要,对话策略的持续强化学习在很大程度上仍未得到解决。缺乏带有训练协议、基线模型和合适指标的框架,迄今阻碍了该方向的研究。在这项工作中,我们恰好填补了这一空白,使对话策略优化的研究从静态学习走向动态学习。我们提供了一种持续学习算法、用于评估持续学习模型的基线架构与指标。此外,我们提出了动态对话策略Transformer(DDPT),一种能够无缝整合新知识、可处理大状态空间并在暴露于未见领域时获得显著零样本性能的新型动态架构,且网络参数规模无任何增长。
引用
@article{arxiv.2204.05928,
title = {Dynamic Dialogue Policy for Continual Reinforcement Learning},
author = {Christian Geishauser and Carel van Niekerk and Nurul Lubis and Michael Heck and Hsien-Chin Lin and Shutong Feng and Milica Gašić},
journal= {arXiv preprint arXiv:2204.05928},
year = {2022}
}