中文

简单更佳且大非足够:走向基础语言模型的集成

计算与语言 2023-08-24 v1 人工智能

摘要

基础语言模型(FLMs)已推进了自然语言处理(NLP)研究。当前研究者正在开发更大的 FLMs(如 XLNet、T5)以实现上下文化语言表示、分类与生成。虽然开发更大的 FLMs 具有显著优势,但其在幻觉与预测不确定性方面也是一项隐患。根本上,更大的 FLMs 建立在与较小 FLMs(如 BERT)相同的基础之上;因此,必须认识到较小 FLMs 通过集成可实现的潜力。在当前研究中,我们对 FLMs 及其集成在基准与真实世界数据集上进行了现实检验。我们假设 FLMs 的集成能够影响 FLMs 的个体注意力,并揭示不同 FLMs 间协调与合作的实力。我们利用 BERT 并定义了另外三种集成技术:{浅层、半层、深层},其中深层集成引入了知识引导的强化学习方法。我们发现所提出的深层集成 BERT 在展示 NLP 在诸如心理健康等敏感领域有用性的数据集上,以数倍优势优于其大型变体即 BERTlarge。

关键词

引用

@article{arxiv.2308.12272,
  title  = {Simple is Better and Large is Not Enough: Towards Ensembling of Foundational Language Models},
  author = {Nancy Tyagi and Aidin Shiri and Surjodeep Sarkar and Abhishek Kumar Umrawal and Manas Gaur},
  journal= {arXiv preprint arXiv:2308.12272},
  year   = {2023}
}

备注

Accepted at the 10th Mid-Atlantic Student Colloquium on Speech, Language and Learning (MASC-SLL 2023)