面向口语对话系统策略优化的在线主动奖励学习
计算与语言
2016-06-03 v2 机器学习
摘要
计算准确的奖励函数对于通过强化学习优化对话策略至关重要。在现实应用中,使用显式用户反馈作为奖励信号通常不可靠且收集成本高昂。如果用户的意图事先已知,或有数据可用于离线预训练任务成功预测器,这一问题可以得到缓解。但在实践中,大多数现实应用都无法满足这些条件。本文提出一种在线学习框架,通过基于高斯过程模型的主动学习,使对话策略与奖励模型联合训练。该高斯过程作用于由循环神经网络编码器-解码器以无监督方式生成的连续空间对话表示。实验结果表明,所提出的框架能够显著降低数据标注成本,并减轻对话策略学习中噪声用户反馈的影响。
引用
@article{arxiv.1605.07669,
title = {On-line Active Reward Learning for Policy Optimisation in Spoken Dialogue Systems},
author = {Pei-Hao Su and Milica Gasic and Nikola Mrksic and Lina Rojas-Barahona and Stefan Ultes and David Vandyke and Tsung-Hsien Wen and Steve Young},
journal= {arXiv preprint arXiv:1605.07669},
year = {2016}
}
备注
Accepted as a long paper in ACL 2016