中文

NukeLM:面向核与能源领域的预训练及微调语言模型

计算与语言 2021-05-27 v1

摘要

自然语言处理(NLP)任务(文本分类、命名实体识别等)在过去几年中取得了革命性进展。这得益于诸如 BERT 等语言模型,其通过使用大型预训练模型然后在特定任务上微调模型来实现深度知识迁移。当使用领域相关文本对模型进行预训练时,BERT 架构在领域特定任务上表现出更好的性能。受这些近期进展启发,我们开发了 NukeLM,一个在来自美国能源部科学与技术信息办公室(OSTI)数据库的 150 万篇摘要上预训练的核领域语言模型。该 NukeLM 模型随后被微调,用于将研究文章分类为二分类(与核燃料循环 [NFC] 相关或不相关)或与文章主题相关的多类别。我们表明,在微调之前对 BERT 风格架构进行持续预训练,在两个文章分类任务上均产生更优性能。这些信息对于恰当分流稿件至关重要,这是更好理解核领域出版物的引用网络以及发掘核(或核相关)领域新研究方向的必要任务。

关键词

引用

@article{arxiv.2105.12192,
  title  = {NukeLM: Pre-Trained and Fine-Tuned Language Models for the Nuclear and Energy Domains},
  author = {Lee Burke and Karl Pazdernik and Daniel Fortin and Benjamin Wilson and Rustam Goychayev and John Mattingly},
  journal= {arXiv preprint arXiv:2105.12192},
  year   = {2021}
}

备注

11 pages, 2 figures