中文

不要随机掩码:通过掩码域内关键词实现有效的领域自适应预训练

计算与语言 2023-07-17 v1 机器学习

摘要

我们提出了一种新颖的与任务无关的域内预训练方法,位于通用预训练与微调之间。我们的方法选择性地掩码域内关键词,即提供目标领域紧凑表示的词。我们使用KeyBERT (Grootendorst, 2020)识别此类关键词。我们使用六种不同设置评估我们的方法:三个数据集结合两个不同的预训练语言模型(PLM)。我们的结果显示,使用我们的域内预训练策略微调的PLM优于采用随机掩码域内预训练的PLM以及遵循常见预训练后微调范式的PLM。此外,识别域内关键词的开销是合理的,例如,对于BERT Large (Devlin et al., 2019),两个轮次的预训练时间为7-15%。

关键词

引用

@article{arxiv.2307.07160,
  title  = {Do not Mask Randomly: Effective Domain-adaptive Pre-training by Masking In-domain Keywords},
  author = {Shahriar Golchin and Mihai Surdeanu and Nazgol Tavabi and Ata Kiapour},
  journal= {arXiv preprint arXiv:2307.07160},
  year   = {2023}
}

备注

final version: accepted at ACL'23 RepL4NLP. arXiv admin note: text overlap with arXiv:2208.12367