预训练卷积网络是否优于预训练 Transformer?
计算与语言
2022-02-01 v2 机器学习
摘要
在预训练语言模型时代,Transformer 是事实上的模型架构选择。尽管近期研究展示了完全卷积或 CNN 架构的潜力,但它们尚未在预训练—微调范式下被探索。在语言模型的语境中,卷积模型在预训练后是否与 Transformer 具有竞争力?本文探究了这一研究问题并给出了若干有趣的发现。在覆盖 8 个数据集/任务的广泛实验中,我们发现基于 CNN 的预训练模型具有竞争力,并在某些场景下优于其 Transformer 对应模型,尽管存在注意事项。总体而言,本文所述发现表明,将预训练进展与架构进展混为一谈是误导性的,二者应被独立考量。我们相信本研究为替代架构的适度乐观开辟了道路。
引用
@article{arxiv.2105.03322,
title = {Are Pre-trained Convolutions Better than Pre-trained Transformers?},
author = {Yi Tay and Mostafa Dehghani and Jai Gupta and Dara Bahri and Vamsi Aribandi and Zhen Qin and Donald Metzler},
journal= {arXiv preprint arXiv:2105.03322},
year = {2022}
}
备注
ACL'21 + updated code/ckpt pointers