SkillNet-NLU:一种用于通用自然语言理解的稀疏激活模型
计算与语言
2022-05-10 v4 人工智能
机器学习
摘要
主流深度模型是单一用途的,并在个别任务上过度专门化。然而,当扩展到新任务时,它们通常会遗忘先前学到的技能并从头学起。我们通过引入SkillNet-NLU来解决此问题,这是一种通过将已有技能拼接在一起来更有效地学习新任务的通用模型。我们方法的关键特征是它由预定义技能引导而稀疏激活。不同于总是激活所有模型参数的传统稠密模型,SkillNet-NLU仅激活其技能与目标任务相关的部分模型参数。当学习新任务时,我们的方法精确激活所需技能,并提供添加新技能的选项。我们在自然语言理解任务上评估并有以下发现。首先,仅用一个模型检查点,SkillNet-NLU在六个任务上优于任务特定微调和两个多任务学习基线(即稠密模型和混合专家模型)。其次,稀疏激活预训练进一步提升了整体性能。第三,SkillNet-NLU在扩展到新任务时显著优于基线系统。
引用
@article{arxiv.2203.03312,
title = {SkillNet-NLU: A Sparsely Activated Model for General-Purpose Natural Language Understanding},
author = {Fan Zhang and Duyu Tang and Yong Dai and Cong Zhou and Shuangzhi Wu and Shuming Shi},
journal= {arXiv preprint arXiv:2203.03312},
year = {2022}
}