AF Adapter:用于构建中文生物医学语言模型的持续预训练方法
计算与语言
2024-02-09 v2 机器学习
摘要
持续预训练是从通用领域语言模型构建特定领域预训练语言模型的一种流行方法。尽管其高效,持续预训练存在灾难性遗忘问题,可能损害模型在下游任务中的性能。为缓解该问题,本文提出一种针对基于 BERT 模型的持续预训练方法,称为 Attention-FFN Adapter(注意力-前馈网络适配器)。其主要思想是在每个自注意力层和前馈网络内部引入少量注意力头和隐藏单元。此外,我们训练了一个基于 RoBERTa 的、面向中文生物医学领域的特定领域语言模型,名为 AF Adapter。在实验中,模型被应用于下游任务进行评估。结果表明,仅训练约 17% 的模型参数,AF Adapter 相比强基线平均性能提升 0.6%、2%。进一步的实验结果显示,与微调方法相比,我们的方法将灾难性遗忘问题缓解了 11%。
引用
@article{arxiv.2211.11363,
title = {AF Adapter: Continual Pretraining for Building Chinese Biomedical Language Model},
author = {Yongyu Yan and Kui Xue and Xiaoming Shi and Qi Ye and Jingping Liu and Tong Ruan},
journal= {arXiv preprint arXiv:2211.11363},
year = {2024}
}