中文

预训练卷积网络是否优于预训练 Transformer?

计算与语言 2022-02-01 v2 机器学习

摘要

在预训练语言模型时代,Transformer 是事实上的模型架构选择。尽管近期研究展示了完全卷积或 CNN 架构的潜力,但它们尚未在预训练—微调范式下被探索。在语言模型的语境中,卷积模型在预训练后是否与 Transformer 具有竞争力?本文探究了这一研究问题并给出了若干有趣的发现。在覆盖 8 个数据集/任务的广泛实验中,我们发现基于 CNN 的预训练模型具有竞争力,并在某些场景下优于其 Transformer 对应模型,尽管存在注意事项。总体而言,本文所述发现表明,将预训练进展与架构进展混为一谈是误导性的,二者应被独立考量。我们相信本研究为替代架构的适度乐观开辟了道路。

关键词

引用

@article{arxiv.2105.03322,
  title  = {Are Pre-trained Convolutions Better than Pre-trained Transformers?},
  author = {Yi Tay and Mostafa Dehghani and Jai Gupta and Dara Bahri and Vamsi Aribandi and Zhen Qin and Donald Metzler},
  journal= {arXiv preprint arXiv:2105.03322},
  year   = {2022}
}

备注

ACL'21 + updated code/ckpt pointers