中文

面向任务完成对话系统的抗过高估计对话策略学习

计算与语言 2024-04-16 v2 人工智能

摘要

对话策略模块是任务完成对话系统的重要组成部分。近年来,基于强化学习(RL)的对话策略受到越来越多的关注。其良好的性能和明智的动作决策依赖于对动作价值的准确估计。过高估计问题是RL的一个广为人知的问题,因为其对最大动作价值的估计大于真实值,这导致学习过程不稳定和次优策略。该问题对基于RL的对话策略学习是有害的。为缓解此问题,本文提出一种对真实最大动作价值的动态部分平均估计器(DPAV)。DPAV计算预测最大动作价值与最小动作价值之间的部分平均,其中权重是动态自适应且依赖于具体问题的。我们将DPAV融入深度Q网络作为对话策略,并在三个不同领域的对话数据集上表明,我们的方法能以更低的计算负载取得优于或可与顶级基线相媲美的结果。此外,我们还从理论上证明了收敛性,并推导了与其他方法相比偏差的上下界。

关键词

引用

@article{arxiv.2207.11762,
  title  = {Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System},
  author = {Chang Tian and Wenpeng Yin and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2207.11762},
  year   = {2024}
}

备注

NAACL Findings 2022, see https://aclanthology.org/2022.findings-naacl.43