利用迁移强化学习实现对话系统个性化
人工智能
2017-05-29 v3 计算与语言
机器学习
摘要
训练个性化的任务导向对话系统十分困难,因为从每个个体收集的数据通常不足。在小数据集上训练的个性化对话系统可能过拟合,难以适应不同用户的需求。解决该问题的一种方法是,将多个用户数据的集合视为源域,将单个用户的数据视为目标域,并执行从源域到目标域的迁移学习。遵循这一思路,我们提出“PETAL”(个性化任务导向对话),一个基于 POMDP 的迁移学习框架,用于学习个性化对话系统。该系统首先从源域学习通用对话知识,然后将此知识适配到目标用户。该框架通过考虑源用户与目标用户之间的差异,能够避免负迁移问题。个性化 POMDP 中的策略可以学习为不同用户恰当地选择不同动作。在真实咖啡购物数据和模拟数据上的实验结果表明,我们的个性化对话系统能够为不同用户选择不同的最优动作,从而在个性化设定下有效提升对话质量。
引用
@article{arxiv.1610.02891,
title = {Personalizing a Dialogue System with Transfer Reinforcement Learning},
author = {Kaixiang Mo and Shuangyin Li and Yu Zhang and Jiajun Li and Qiang Yang},
journal= {arXiv preprint arXiv:1610.02891},
year = {2017}
}