通过自举互信息正则化器获得更好的长程依赖
机器学习
2020-02-25 v2 计算与语言
机器学习
摘要
在本工作中,我们开发了一种新颖的正则化器以改善序列数据的长程依赖学习。应用于语言建模时,我们的正则化器表达了这样一种归纳偏置:即使模型可能未观察到复杂长程依赖的充足观测数据,序列变量也应具有高互信息。我们展示了如何从我们的互信息估计框架中以有原则的方式导出“下一句预测(分类)”启发式方法,并将其进一步扩展以最大化序列变量的互信息。所提出的方法不仅能有效增加所学模型下片段的互信息,更重要的是,它还能提高留存数据上的似然并改善生成质量。代码已发布于 https://github.com/BorealisAI/BMI。
引用
@article{arxiv.1905.11978,
title = {Better Long-Range Dependency By Bootstrapping A Mutual Information Regularizer},
author = {Yanshuai Cao and Peng Xu},
journal= {arXiv preprint arXiv:1905.11978},
year = {2020}
}
备注
Camera-ready for AISTATS 2020