强化学习在电子邮件口语对话系统对话策略选择中的应用
人工智能
2011-06-02 v1
摘要
本文描述了一种新颖的方法,通过该方法,口语对话系统可以从与人类用户交互的经验中学习选择最优对话策略。该方法基于强化学习与口语对话系统性能建模的结合。强化学习组件应用 Q-learning(Watkins, 1989),而性能建模组件应用 PARADISE 评估框架(Walker et al., 1997)来学习强化学习中使用的性能函数(奖励)。我们以一个名为 ELVIS(EmaiL Voice Interactive System,邮件语音交互系统)的口语对话系统为例说明该方法,该系统支持通过电话访问电子邮件。我们进行了一组实验,在包含 219 个对话的语料库上训练最优对话策略,这些对话是人类用户通过电话与 ELVIS 交互产生的。然后我们在一个包含 18 个对话的语料库上测试该策略。我们证明,ELVIS 能够学习优化其在智能体主导、阅读消息和总结邮件文件夹方面的策略选择。
引用
@article{arxiv.1106.0241,
title = {An Application of Reinforcement Learning to Dialogue Strategy Selection in a Spoken Dialogue System for Email},
author = {M. A. Walker},
journal= {arXiv preprint arXiv:1106.0241},
year = {2011}
}