Sequence Tutor:基于KL控制的序列生成模型保守微调
机器学习
2017-10-18 v9 人工智能
摘要
本文提出一种通用方法,用于改进循环神经网络(RNN)生成序列的结构与质量,同时保持最初从数据学习到的信息以及样本多样性。首先使用最大似然估计(MLE)在数据上预训练一个 RNN,并将该模型学习到的序列下一词元的概率分布视为先验策略。随后使用强化学习(RL)训练另一个 RNN,以生成考虑领域特定激励且同时保持接近 MLE RNN 先验策略的更高质量输出。为形式化该目标,我们从 KL 控制推导出用于 RNN 的新颖离策略强化学习方法。该方法的有效性在两个应用中得到展示:1)生成新颖音乐旋律,以及 2)计算分子生成。对于这两个问题,我们表明所提方法改善了生成序列的期望属性与结构,同时保持从数据学习到的信息。
引用
@article{arxiv.1611.02796,
title = {Sequence Tutor: Conservative Fine-Tuning of Sequence Generation Models with KL-control},
author = {Natasha Jaques and Shixiang Gu and Dzmitry Bahdanau and José Miguel Hernández-Lobato and Richard E. Turner and Douglas Eck},
journal= {arXiv preprint arXiv:1611.02796},
year = {2017}
}
备注
Add supplementary material