基于体裁和主题特征的选择性掩码实现语言模型对专业领域的适应
计算与语言
2024-02-27 v2
摘要
预训练语言模型的最新进展促进了各种自然语言处理(NLP)任务的显著进步。模型训练中的单词掩码构成了BERT等架构中语言建模的关键组成部分。然而,主流的单词掩码方法依赖于随机选择,可能忽略了领域特定的语言属性。在本文中,我们介绍了一种创新的掩码方法,利用体裁和主题信息来使语言模型适应专业领域。我们的方法包含一个排序过程,根据单词的重要性对其进行优先级排序,随后指导掩码过程。在法律领域使用持续预训练进行的实验证明了我们的方法在英语LegalGLUE基准上的有效性。预训练语言模型和代码均可免费使用。
引用
@article{arxiv.2402.12036,
title = {Language Model Adaptation to Specialized Domains through Selective Masking based on Genre and Topical Characteristics},
author = {Anas Belfathi and Ygor Gallina and Nicolas Hernandez and Richard Dufour and Laura Monceaux},
journal= {arXiv preprint arXiv:2402.12036},
year = {2024}
}