面向专家混合对话管理的离线强化学习
机器学习
2023-10-31 v2 人工智能
计算与语言
摘要
强化学习 (RL) 在开发非短视、能进行丰富对话并最大化整体用户满意度的对话管理 (DM) 智能体方面展现出巨大潜力。尽管 RL 与语言模型 (LMs) 近期有所发展,使用 RL 驱动对话聊天机器人仍具挑战,部分原因在于 RL 需要在线探索以有效学习,而收集新颖的人机交互可能代价高昂且不安全。这些算法面临组合动作空间,使问题加剧,因为多数 LM 智能体在词级别生成回复。我们开发了多种专用于对话规划的 RL 算法,其利用近期的专家混合语言模型 (MoE-LMs)——此类模型捕捉多样语义、生成反映不同意图的话语,并适用于多轮 DM。通过利用 MoE-LM 结构,我们的方法显著缩减动作空间规模并提升基于 RL 的 DM 效能。我们在开放域对话中评估了方法,以证明其在生成话语意图多样性与整体 DM 性能上的有效性。
引用
@article{arxiv.2302.10850,
title = {Offline Reinforcement Learning for Mixture-of-Expert Dialogue Management},
author = {Dhawal Gupta and Yinlam Chow and Aza Tulepbergenov and Mohammad Ghavamzadeh and Craig Boutilier},
journal= {arXiv preprint arXiv:2302.10850},
year = {2023}
}
备注
Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)