中文

ScaLearn:通过学缩放实现简单且极高参数效率的任务迁移

机器学习 2024-05-20 v3 人工智能 计算与语言

摘要

多任务学习(MTL)已展现出显著的实用益处,尤其在使用语言模型(LMs)时。虽然这通常通过在联合优化流程下学习 nn 个任务来实现,但某些方法(如 AdapterFusion)将该问题分为两个阶段:(i)任务学习,将特定于某任务的知识封装在参数集(如适配器)中;(ii)迁移,将已学知识用于目标任务。这种关注点分离带来了诸多好处(如促进可复用性)。然而,当前两阶段 MTL 引入了大量额外参数。我们通过利用线性缩放源适配器输出表示以用于迁移学习的有效性来解决此问题。我们提出 ScaLearn,一种简单且极高参数效率的两阶段 MTL 方法,它通过学习一组极小的缩放参数来实现对源任务知识的有效迁移至目标任务。我们在三个基准(GLUE、SuperGLUE 和 HumSet)及两个编码器 LM 上的实验表明,ScaLearn 以极少的迁移参数(约为 AdapterFusion 的 0.350.35%)持续优于强基线。值得注意的是,我们观察到 ScaLearn 在进一步缩减参数时仍保持强劲能力,仅用每目标任务 88 个迁移参数即可取得有竞争力的结果。因此,我们提出的方法展示了简单缩放的力量,预示着更高效的任务迁移。

关键词

引用

@article{arxiv.2310.01217,
  title  = {ScaLearn: Simple and Highly Parameter-Efficient Task Transfer by Learning to Scale},
  author = {Markus Frohmann and Carolin Holtermann and Shahed Masoudian and Anne Lauscher and Navid Rekabsaz},
  journal= {arXiv preprint arXiv:2310.01217},
  year   = {2024}
}

备注

Accepted to Findings of the ACL: ACL 2024