中文

预训练Transformer的非参数变分正则化

机器学习 2023-12-04 v1 计算与语言

摘要

大规模预训练与微调Transformer大语言模型的当前范式在自然语言处理各领域取得了显著改进。然而,此类大模型易对其训练数据过拟合,因此当领域变化时模型表现不佳。同时,由于模型规模,将模型微调至新领域的成本很高。非参数变分信息瓶颈(NVIB)已被提出作为Transformer中交叉注意力训练的正则化器,有望解决过拟合问题。我们将NVIB框架扩展以替换Transformer中所有类型的注意力函数,并表明使用所提出的恒等初始化,现有的预训练Transformer可被重新解释为非线性参数变分(NV)模型。接着我们表明,改变初始化会在注意力机制中引入一种新颖的、基于信息论的训练后正则化,无需任何训练即可改善域外泛化。这一成功支持了预训练Transformer是隐式NV贝叶斯模型的假设。

关键词

引用

@article{arxiv.2312.00662,
  title  = {Nonparametric Variational Regularisation of Pretrained Transformers},
  author = {Fabio Fehr and James Henderson},
  journal= {arXiv preprint arXiv:2312.00662},
  year   = {2023}
}