中文

通过认知神经网络微调语言模型

计算与语言 2023-05-12 v2 人工智能

摘要

语言模型通常在大型无监督文本语料库上预训练,然后在额外的任务特定数据上微调。然而,典型的微调方案并不对其所调优的样本进行优先级排序。我们表明,若能对信息量丰富的训练数据进行优先级排序,便可在使用更少标签的同时取得更优性能。为此,我们为语言模型增补一个 epinet:一个有助于估计模型不确定性并形成\textit{认知神经网络}(ENN)的小型附加网络。ENNs 是能够知晓自身未知之处的神经网络。利用 epinet 对不确定数据进行优先级排序,我们可在 GLUE 任务上以相较于无优先级排序训练少 2 倍的数据将 BERT 微调至相同性能。我们还考察了为建立理解而设计的合成神经网络生成模型中的表现。在各设定下,使用 epinet 均优于启发式主动学习方案。

关键词

引用

@article{arxiv.2211.01568,
  title  = {Fine-Tuning Language Models via Epistemic Neural Networks},
  author = {Ian Osband and Seyed Mohammad Asghari and Benjamin Van Roy and Nat McAleese and John Aslanides and Geoffrey Irving},
  journal= {arXiv preprint arXiv:2211.01568},
  year   = {2023}
}