中文

一种面向任务型对话系统的异步更新强化学习框架

计算与语言 2023-05-10 v1 人工智能 人机交互

摘要

许多工作已将强化学习应用于训练对话系统。以往方法将对话系统划分为包括DST(对话状态跟踪)和DP(对话策略)在内的多个模块,并同时训练这些模块。然而,不同模块在训练过程中相互影响:DST的错误可能误导对话策略,而系统动作给DST模块带来额外困难。为缓解该问题,我们提出异步更新强化学习框架(AURL),在协作设定下异步更新DST模块与DP模块。此外,引入课程学习以解决强化学习采样中数据分布不均衡的问题,并采用多个用户模型以增加对话多样性。在公开SSC-PHONE数据集上的结果表明,我们的方法取得了令人信服的结果,对话成功率提升了31.37%。代码已公开于 https://github.com/shunjiu/AURL。

关键词

引用

@article{arxiv.2305.02718,
  title  = {An Asynchronous Updating Reinforcement Learning Framework for Task-oriented Dialog System},
  author = {Sai Zhang and Yuwei Hu and Xiaojie Wang and Caixia Yuan},
  journal= {arXiv preprint arXiv:2305.02718},
  year   = {2023}
}

备注

Accepted by ICASSP 2023