面向结构化预测的近似推断网络学习
计算与语言
2018-03-12 v1 机器学习
机器学习
摘要
结构化预测能量网络(SPENs;Belanger & McCallum 2016)使用神经网络架构定义能量函数,可捕捉结构化输出各部分之间的任意依赖关系。先前工作使用梯度下降进行推断,将结构化输出松弛为一组连续变量,然后相对于它们优化能量。我们用一个经训练以近似结构化argmax推断的神经网络替代这种梯度下降的使用。该“推断网络”输出连续值,我们将其视为输出结构。我们提出了用于结构化能量函数与推断网络联合训练的大间隔训练准则。在多标签分类上,我们报告了相比(Belanger et al, 2017)10-60倍的加速,同时准确率也有所提升。对于具有简单结构化能量的序列标注,我们的方法性能与精确推断相当,而在测试时快得多。随后我们通过用对整体输出标签序列打分的“标签语言模型”增强能量,展示了准确率的提升,表明其可改善词性标注中长期依赖的处理。最后,我们展示了推断网络如何在条件随机场中替代动态规划进行测试时推断,暗示了它们在结构化环境中用于快速推断的普遍适用性。
引用
@article{arxiv.1803.03376,
title = {Learning Approximate Inference Networks for Structured Prediction},
author = {Lifu Tu and Kevin Gimpel},
journal= {arXiv preprint arXiv:1803.03376},
year = {2018}
}
备注
accepted by ICLR2018