引导式对话策略学习为何表现优异?理解对抗学习的作用及其替代方案
计算与语言
2023-07-14 v1 机器学习
摘要
对话策略在每个对话轮次根据当前状态决定系统动作,是对话成功的关键。近年来,强化学习(RL)已成为对话策略学习(DPL)的一种有前景选择。在基于 RL 的 DPL 中,对话策略依据奖励更新。在多域任务型对话场景中,状态—动作组合众多,手动构建细粒度奖励(如基于状态—动作的奖励)以有效引导对话策略颇具挑战。一种从收集数据估计奖励的方式是利用对抗学习(AL)同时训练奖励估计器与对话策略。尽管该方法在实验上展现出优越性能,却充斥着 AL 的固有问题,如模式崩溃。本文首先通过对对话策略与奖励估计器目标函数的细致分析,厘清 AL 在 DPL 中的作用。接着,基于这些分析,我们提出一种从奖励估计与 DPL 中剔除 AL 同时保留其优势的方法。我们使用多域任务型对话语料库 MultiWOZ 评估了我们的方法。
引用
@article{arxiv.2307.06721,
title = {Why Guided Dialog Policy Learning performs well? Understanding the role of adversarial learning and its alternative},
author = {Sho Shimoyama and Tetsuro Morimura and Kenshi Abe and Toda Takamichi and Yuta Tomomatsu and Masakazu Sugiyama and Asahi Hentona and Yuuki Azuma and Hirotaka Ninomiya},
journal= {arXiv preprint arXiv:2307.06721},
year = {2023}
}