中文

针对多标签文本分类与命名实体识别的 LegalTurk 优化 BERT

计算与语言 2024-07-02 v1

摘要

Transformer 神经网络的引入,以及自监督预训练和迁移学习等技术的应用,为像 BERT 这样的高级模型铺平了道路。尽管 BERT 在性能方面表现突出,但仍存在进一步提升的潜力。据我们了解,大多数努力都在提升 BERT 在英语以及一般领域的性能,没有针对法律土耳其语领域的研究。在本研究中,我们致力于通过修改预训练阶段来增强法律土耳其语领域中的 BERT 模型。在本文中,我们提出了一种创新的修改预训练方法,通过结合多样化的遮盖策略来实现。在微调任务中,我们聚焦于法律领域的两个关键下游任务:命名实体识别和多标签文本分类。为评估我们修改后的预训练方法,我们对所有定制模型以及原始 BERT 模型进行了微调以进行比较。我们的修改方法在命名实体识别和多标签文本分类任务中均显著优于原始 BERT 模型。最后,为展示我们所提出模型的影响,我们使用不同规模的语料库训练我们的优质模型并与 BERTurk 模型进行比较。实验结果表明,我们所创新的方法尽管在较小语料库上进行预训练,仍能与 BERTurk 相当。

关键词

引用

@article{arxiv.2407.00648,
  title  = {LegalTurk Optimized BERT for Multi-Label Text Classification and NER},
  author = {Farnaz Zeidi and Mehmet Fatih Amasyali and Çiğdem Erol},
  journal= {arXiv preprint arXiv:2407.00648},
  year   = {2024}
}