中文

EOS 决策与长度外推

计算与语言 2020-10-15 v1

摘要

对未见序列长度的外推是语言神经生成模型面临的一项挑战。在本工作中,我们刻画了一个常被忽视的建模决策对长度外推的影响:通过使用特殊的序列结束(end-of-sequence, EOS)词表项来预测生成过程的结束。我们研究了一种预言机设置——在测试时强制模型生成至正确的序列长度——以比较训练来预测 EOS 的网络(+EOS)与未训练来预测 EOS 的网络(-EOS)的长度外推行为。我们发现 -EOS 大幅优于 +EOS,例如在括号闭合任务中能很好地外推到比训练时所见长度长 10 倍的长度,并在困难的 SCAN 数据集长度泛化任务中取得比 +EOS 高 40% 的提升。通过比较 -EOS 与 +EOS 模型的隐藏状态与动态,我们观察到 +EOS 模型泛化失败是因为它们(1)不必要地按其在线性的序列中的位置对其隐藏状态进行分层(我们称之为长度流形的结构),或(2)一旦 EOS 词元成为最高概率预测,便陷入簇中(我们称之为长度吸引子)。

关键词

引用

@article{arxiv.2010.07174,
  title  = {The EOS Decision and Length Extrapolation},
  author = {Benjamin Newman and John Hewitt and Percy Liang and Christopher D. Manning},
  journal= {arXiv preprint arXiv:2010.07174},
  year   = {2020}
}

备注

16 page, 7 Figures, 9 Tables, Blackbox NLP Workshop at EMNLP 2020