中文

通过关注结构量化嵌入在 Transformer 中引入系统性

计算与语言 2024-02-12 v1 人工智能 机器学习

摘要

Transformer 在复杂数据集上训练后,能够泛化到结构和实体的新颖组合,但在复杂度不足的数据集上容易过拟合。我们观察到,当训练集具有足够复杂度时,模型会使用系统性的注意力模式来编码具有共同句法结构的句子。受此观察启发,我们提出了 SQ-Transformer(结构量化),即使在低复杂度训练集上,它也能在嵌入层和注意力层中明确地鼓励系统性。在嵌入层,我们引入了面向结构的向量量化(SoVQ),将词嵌入聚类为几类结构等价的实体。在注意力层,我们设计了系统性注意力层(SAL)及其替代方案系统性正则化层(SRL),它们在量化的词嵌入上操作,使得相同结构的句子以不变或相似的注意力模式进行编码。实验表明,在多个低复杂度语义解析和机器翻译数据集上,SQ-Transformer 比原始 Transformer 具有更强的组合泛化能力。在我们的分析中,我们表明 SoVQ 确实学习到了一个句法聚类的嵌入空间,而 SAL/SRL 诱导出了可泛化的注意力模式,从而提高了系统性。

关键词

引用

@article{arxiv.2402.06492,
  title  = {Inducing Systematicity in Transformers by Attending to Structurally Quantized Embeddings},
  author = {Yichen Jiang and Xiang Zhou and Mohit Bansal},
  journal= {arXiv preprint arXiv:2402.06492},
  year   = {2024}
}

备注

22 pages, code: https://github.com/jiangycTarheel/SQ-Transformer