中文

改进推理网络与结构化预测能量网络的联合训练

计算与语言 2020-10-13 v2 机器学习

摘要

深度基于能量的模型功能强大,但给学习和推理带来挑战(Belanger 和 McCallum,2016)。Tu 和 Gimpel(2018)通过训练“推理网络”来近似结构化推理而非使用梯度下降,开发了基于能量模型的高效框架。然而,他们的交替优化方法在训练期间存在不稳定性,需要额外的损失项和细致的超参数调优。在本文中,我们贡献了若干策略以稳定并改进能量函数与推理网络用于结构化预测的联合训练。我们设计了一个复合目标,以联合训练成本增强和测试时推理网络以及能量函数。我们提出推理网络的联合参数化,以鼓励它们在学习中捕获互补功能。我们在两个序列标注任务上实证验证了我们的策略,显示出比先前工作更易于获得强劲性能的路径,以及通过全局能量项的进一步提升。

关键词

引用

@article{arxiv.1911.02891,
  title  = {Improving Joint Training of Inference Networks and Structured Prediction Energy Networks},
  author = {Lifu Tu and Richard Yuanzhe Pang and Kevin Gimpel},
  journal= {arXiv preprint arXiv:1911.02891},
  year   = {2020}
}

备注

EMNLP 2020 Workshop on Structured Prediction for NLP (SPNLP)