中文

NukeBERT:面向低资源核领域的预训练语言模型

机器学习 2024-09-05 v2 机器学习

摘要

近年来,自然语言处理取得了重大进展,机器在包括但不限于问答在内的许多任务中超越了人类表现。大多数用于问答的深度学习方法针对的是拥有大型数据集和高度成熟文献的领域。核能与原子能领域在利用非标注数据来驱动工业可行应用方面很大程度上仍未被探索。由于缺乏数据集,我们基于 7000 篇核领域研究论文创建了一个新数据集。本文有助于对核领域知识的理解研究,并在作为本研究一部分由核领域专家创建的核问答数据集(NQuAD)上进行了评估。NQuAD 包含 612 个问题,这些问题基于从 IGCAR 研究论文语料库中随机选取的 181 个段落开发。本文提出了核双向编码器表示 Transformer(NukeBERT),其引入了一种构建 BERT 词汇表的新技术,使其适用于训练数据较少的任务。在 NQuAD 上进行的评估实验表明,NukeBERT 能够显著优于 BERT,从而验证了所采用的方法。训练 NukeBERT 的计算成本很高,因此我们将开源 NukeBERT 的预训练权重和 NQuAD,以促进核领域的进一步研究工作。

关键词

引用

@article{arxiv.2003.13821,
  title  = {NukeBERT: A Pre-trained language model for Low Resource Nuclear Domain},
  author = {Ayush Jain and N. M. Meenachi and B. Venkatraman},
  journal= {arXiv preprint arXiv:2003.13821},
  year   = {2024}
}