中文

将对话从死胡同中拯救:面向任务型对话策略优化的高效探索

人机交互 2023-05-08 v1 计算与语言

摘要

使用深度强化学习训练对话策略需要对环境进行大量探索。被浪费的无效探索使其学习低效。本文中,我们发现并定义了导致无效探索的一个重要原因:死胡同。当对话进入死胡同状态时,无论之后采取何种动作,都将延续死胡同轨迹,直至智能体达到终止状态或最大轮次。我们提出一种死胡同复活(DDR)算法,可及时高效地检测初始死胡同状态,并提供救援动作以引导和纠正探索方向。为防止对话策略重复犯同样错误,DDR 还通过添加包含死胡同状态的相关经验来进行对话数据增强。我们首先验证了死胡同检测的可靠性,随后通过在多个不同领域对话数据集上的实验结果展示了该方法的有效性与通用性。

关键词

引用

@article{arxiv.2305.03262,
  title  = {Rescue Conversations from Dead-ends: Efficient Exploration for Task-oriented Dialogue Policy Optimization},
  author = {Yangyang Zhao and Zhenyu Wang and Mehdi Dastani and Shihan Wang},
  journal= {arXiv preprint arXiv:2305.03262},
  year   = {2023}
}