用于神经对话模型在线回复选择的定制化非线性Bandits
计算与语言
2017-11-27 v1
摘要
对话回复选择是会话智能体中迈向自然回复生成的重要一步。现有的神经对话模型工作主要聚焦于使用大量上下文-回复对进行离线有监督学习。本文中,我们关注检索式对话系统中回复选择的在线学习。我们提出一种具有非线性奖励函数的上下文多臂 bandit 模型,该模型利用文本的分布式表示进行在线回复选择。一个双向 LSTM 用于生成对话上下文与回复的分布式表示,并作为上下文 bandit 的输入。在学习该 bandit 时,我们提出一种定制化的 Thompson 采样方法,应用于多项式特征空间以近似奖励。在 Ubuntu Dialogue Corpus 上的实验结果表明,所提方法相较常规线性上下文 bandits 有显著性能提升。此外,我们使用 Recall@k 指标报告了所提神经 bandit 模型在少量在线训练样本下令人鼓舞的回复选择性能。
引用
@article{arxiv.1711.08493,
title = {Customized Nonlinear Bandits for Online Response Selection in Neural Conversation Models},
author = {Bing Liu and Tong Yu and Ian Lane and Ole J. Mengshoel},
journal= {arXiv preprint arXiv:1711.08493},
year = {2017}
}
备注
Accepted at AAAI 2018