中文

神经自回归数据补全的改进训练过程

机器学习 2017-11-27 v1 机器学习

摘要

神经自回归模型是显式密度估计器,在生成建模中达到了最先进的似然值。D维数据分布根据链式法则被分解为自回归形式的一维条件分布之积。数据补全比数据生成更为复杂:模型必须对任意部分观测输入向量推断缺失变量。先前工作引入了用于自回归模型数据补全的序无关训练过程。任意部分观测输入向量中的缺失变量可通过选择观测维度先于未观测维度的顺序、并按此顺序计算自回归乘积来高效填补。本文中,我们提供证据表明该序无关(OA)训练过程对数据补全是次优的。我们提出一种替代过程(OA++),以更少的计算达到更好性能。它能处理所有数据补全查询,同时比OA过程训练更少的一维条件分布。此外,这些一维条件分布按其推断时的预期使用比例进行训练,减轻了过拟合。最后,与OA不同,我们的OA++过程可利用关于推断补全查询分布的先验知识。我们在用于评估自回归生成模型的标准数据集上以定量实验支持了上述论断。

关键词

引用

@article{arxiv.1711.08598,
  title  = {An Improved Training Procedure for Neural Autoregressive Data Completion},
  author = {Maxime Voisin and Daniel Ritchie},
  journal= {arXiv preprint arXiv:1711.08598},
  year   = {2017}
}