变分奖励估计器瓶颈:面向多领域任务型对话的鲁棒奖励估计器学习
人工智能
2020-06-02 v1 计算与语言
摘要
尽管对抗学习方法在多领域任务型对话系统中取得了显著成功,但通过对抗逆强化学习训练对话策略往往难以平衡策略生成器与奖励估计器的性能。在优化过程中,奖励估计器常压倒策略生成器并产生过度无信息的梯度。我们提出变分奖励估计器瓶颈(VRB),这是一种有效的正则化方法,旨在约束输入与奖励估计器间无益的信息流。VRB通过利用互信息上的信息瓶颈,聚焦于捕捉判别性特征。在多领域任务型对话数据集上的实证结果表明,VRB显著优于先前方法。
引用
@article{arxiv.2006.00417,
title = {Variational Reward Estimator Bottleneck: Learning Robust Reward Estimator for Multi-Domain Task-Oriented Dialog},
author = {Jeiyoon Park and Chanhee Lee and Kuekyeng Kim and Heuiseok Lim},
journal= {arXiv preprint arXiv:2006.00417},
year = {2020}
}