中文

针对德语命名实体识别训练的小规模 BERT 模型优化

计算与语言 2021-11-02 v2 人工智能

摘要

目前,训练语言模型最广泛的神经网络架构是所谓的 BERT,其在各种自然语言处理(NLP)任务中带来了性能提升。一般而言,BERT 模型参数数量越大,在这些 NLP 任务中取得的结果越好。遗憾的是,模型规模增大会导致内存消耗和训练时长急剧增加。在本文中,我们研究了较小 BERT 模型的多种训练技术:我们结合了来自其他 BERT 变体(如 ALBERT、RoBERTa 和相对位置编码)的不同方法。此外,我们提出了两种新的微调改进以获得更好性能:Class-Start-End 标注和一种改进形式的线性链条件随机场(Linear Chain Conditional Random Fields)。进一步,我们引入了 Whole-Word Attention,其相比经典的多头注意力(Multi-Head-Attention)减少了 BERT 的内存使用并带来微小的性能提升。我们在五个公开的德语命名实体识别(NER)任务上评估了这些技术,其中两个任务由本文提出。

关键词

引用

@article{arxiv.2104.11559,
  title  = {Optimizing small BERTs trained for German NER},
  author = {Jochen Zöllner and Konrad Sperfeld and Christoph Wick and Roger Labahn},
  journal= {arXiv preprint arXiv:2104.11559},
  year   = {2021}
}