在小数据集上优化更深的Transformer模型
计算与语言
2021-06-01 v4 机器学习
摘要
人们普遍认为,从头训练深层Transformer需要大型数据集。因此,对于小数据集,人们通常在微调时在预训练模型之上使用浅层且简单的附加层。本工作表明这并非总是必要:通过恰当的初始化与优化,极深Transformer的优势可延续到具有小数据集的挑战性任务,包括Text-to-SQL语义解析与逻辑阅读理解。具体而言,我们成功训练了层Transformer,包含来自预训练RoBERTa的个微调层与从头训练的个关系感知层。在更少训练步数且无需任务特定预训练的情况下,我们在具有挑战性的跨域Text-to-SQL解析基准Spider上取得了最先进性能。我们通过推导一种受先前T-Fixup工作启发的新型数据依赖Transformer固定更新初始化方案(DT-Fixup)实现了这一点。进一步的误差分析表明,增加深度有助于提升小数据集上需推理与结构理解的困难案例的泛化能力。
关键词
引用
@article{arxiv.2012.15355,
title = {Optimizing Deeper Transformers on Small Datasets},
author = {Peng Xu and Dhruv Kumar and Wei Yang and Wenjie Zi and Keyi Tang and Chenyang Huang and Jackie Chi Kit Cheung and Simon J. D. Prince and Yanshuai Cao},
journal= {arXiv preprint arXiv:2012.15355},
year = {2021}
}
备注
Accepted at ACL 2021 main conference