神经自回归序列建模中的模式恢复
机器学习
2021-06-11 v1 机器学习
摘要
尽管神经自回归序列模型被广泛使用,近期研究揭示了以最大似然训练的此类模型中出乎意料且不期望的性质,例如训练后对短序列不合理的高亲和性,以及解码时对无限长序列的高亲和性。我们提议通过新提出的模式恢复代价,研究分布的真实分布、经验分布、学习分布和解码诱导分布这一完整学习链中模式(或局部极大值)如何被维持,来研究这些现象。我们设计了一个易处理的测试平台,构建了三类真实分布:(1)基于LSTM的结构化分布,(2)序列概率不依赖于其内容的非结构化分布,(3)我们称为半结构化分布的二者乘积。我们的研究揭示了预期和意外的发现。首先,从数据收集开始,模式恢复代价强烈依赖于真实分布,且在半结构化分布下代价最高。其次,学习后,相比数据收集,从真实分布的模式恢复代价可能升高或降低,其中半结构化真实分布下代价退化最大。最后,解码诱导分布从学习分布恢复模式的能力高度受学习链前期选择的影响。我们得出结论:未来研究必须考虑整个学习链,以充分理解神经自回归序列模型的潜力与风险,并进一步改进之。
引用
@article{arxiv.2106.05459,
title = {Mode recovery in neural autoregressive sequence modeling},
author = {Ilia Kulikov and Sean Welleck and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2106.05459},
year = {2021}
}
备注
ACL-IJCNLP 2021 5th Workshop on Structured Prediction for NLP