高效基于适配器的Transformer模型微调方法比较分析
计算与语言
2025-01-15 v1 人工智能
摘要
在本工作中,我们研究了各种适配器架构在监督二进制分类任务(来自 SuperGLUE 基准)以及来自 Kaggle 的监督多类新闻类别分类任务上的效果。具体而言,我们比较了三种Transformer模型(即 DistilBERT、ELECTRA 和 BART)使用常规微调以及九种最新 (SoTA) 适配器架构的分类性能和时间复杂度。我们的分析揭示了适配器架构之间的性能差异,突显了它们在相当于微调的情况下以更小的训练时间实现相当或更好性能的能力。类似的结果在新的分类任务上也得到了支持,这进一步证明了适配器作为微调的高效且灵活的替代方案。本研究为在 diverse natural language processing (NLP) 应用中选择和实施适配器提供了宝贵的见解和指导。
引用
@article{arxiv.2501.08271,
title = {Comparative Analysis of Efficient Adapter-Based Fine-Tuning of State-of-the-Art Transformer Models},
author = {Saad Mashkoor Siddiqui and Mohammad Ali Sheikh and Muhammad Aleem and Kajol R Singh},
journal= {arXiv preprint arXiv:2501.08271},
year = {2025}
}