L3集成方法:基础语言模型的终身学习集成框架
计算与语言
2023-11-14 v1
摘要
针对特定任务微调预训练基础语言模型(FLM)往往不切实际,尤其在资源受限设备上。这亟需开发一个终身学习(L3)框架,能够高效地持续适应自然语言处理(NLP)任务流。我们提出一种方法,侧重于从未知数据中提取有意义的表示、构建结构化知识库,并逐步提升任务性能。我们在多种NLP任务上进行了实验以验证其有效性,包括GLUE和SuperGLUE等基准。我们在准确率、训练效率和知识迁移等指标上均取得了良好表现。初步实验结果表明,所提出的L3集成方法相比微调后的FLM将模型准确率提升了4%~36%。此外,L3模型优于朴素微调方法,同时在给定任务STS基准上相比最先进的语言模型(T5)保持了具有竞争力或更优的性能(准确率最高提升15.4%)。
引用
@article{arxiv.2311.06493,
title = {L3 Ensembles: Lifelong Learning Approach for Ensemble of Foundational Language Models},
author = {Aidin Shiri and Kaushik Roy and Amit Sheth and Manas Gaur},
journal= {arXiv preprint arXiv:2311.06493},
year = {2023}
}