基于强化学习的开放式对话动态规划
计算与语言
2022-08-05 v1 机器学习
摘要
尽管自然语言理解与生成近期取得了进展,且对话机器人开发研究已有数十年,但构建能够在"真实环境"中与人类进行丰富开放式对话的自动化智能体仍是一项艰巨挑战。在本工作中,我们开发了一个实时、开放式的对话系统,使用强化学习(RL)来大规模提升机器人的对话技能。我们的工作将使用SOTA(有监督)语言模型生成的对话状态的简洁嵌入,与特别适用于随对话推进而动态变化的动作空间的RL技术相结合。使用众包数据训练后,我们的新颖系统在针对Google Assistant真实用户的现场实验中,相对于若干关注指标上的(强)基线有监督模型取得了显著超越。
引用
@article{arxiv.2208.02294,
title = {Dynamic Planning in Open-Ended Dialogue using Reinforcement Learning},
author = {Deborah Cohen and Moonkyung Ryu and Yinlam Chow and Orgad Keller and Ido Greenberg and Avinatan Hassidim and Michael Fink and Yossi Matias and Idan Szpektor and Craig Boutilier and Gal Elidan},
journal= {arXiv preprint arXiv:2208.02294},
year = {2022}
}