中文

探索预训练语言模型的模式连通性

计算与语言 2022-10-26 v1 人工智能

摘要

近年来,预训练语言模型(PLMs)在自然语言处理(NLP)中得到了广泛应用。从参数空间的角度看,PLMs提供了通用的初始化,从中可找到高性能极小值。尽管大量工作研究了如何有效且高效地将PLMs适配到高性能极小值,但对于不同适配配置下所达到的各类极小值之间的联系却知之甚少。本文通过模式连通性(mode connectivity)的视角来考察不同极小值的几何联系,该视角衡量两个极小值能否由低损失路径相连。我们开展实证分析以探究三个问题:(1)超参数、特定微调方法和训练数据如何影响PLM的模式连通性?(2)模式连通性在预训练过程中如何变化?(3)沿连接两个极小值的路径,PLM的任务知识如何变化?总体而言,探索PLM的模式连通性有助于理解不同极小值的几何联系,从而帮助我们洞悉PLM下游适配的内在机制。

关键词

引用

@article{arxiv.2210.14102,
  title  = {Exploring Mode Connectivity for Pre-trained Language Models},
  author = {Yujia Qin and Cheng Qian and Jing Yi and Weize Chen and Yankai Lin and Xu Han and Zhiyuan Liu and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2210.14102},
  year   = {2022}
}

备注

EMNLP 2022, main conference