中文

I-BERT:Transformer 对任意上下文长度的归纳泛化

机器学习 2020-06-23 v2 机器学习

摘要

近年来,自注意力已成为最先进的序列到序列自然语言处理模型的关键组件,由预训练双向 Transformer 模型推向前沿。其有效性部分源于其非序列架构,这促进了可扩展性和并行性,但将模型限制于有界长度的输入。特别地,此类架构在算法任务上表现不佳,即模型必须学习一个可泛化到训练中未见的输入长度的过程,我们将此能力称为归纳泛化。在识别现有自注意力机制的计算局限后,我们提出 I-BERT,一种用循环层替换位置编码的双向 Transformer。该模型在多种算法任务上实现归纳泛化,而最先进的 Transformer 模型无法做到。我们还在掩码语言建模任务上测试了我们的方法,其中训练集和验证集被划分以验证归纳泛化。在三个算法和两个自然语言归纳泛化任务中,I-BERT 在四个任务上取得了最先进结果。

关键词

引用

@article{arxiv.2006.10220,
  title  = {I-BERT: Inductive Generalization of Transformer to Arbitrary Context Lengths},
  author = {Hyoungwook Nam and Seung Byum Seo and Vikram Sharma Mailthody and Noor Michael and Lan Li},
  journal= {arXiv preprint arXiv:2006.10220},
  year   = {2020}
}

备注

Submitted to NeurIPS2020