不要随机掩码:通过掩码域内关键词实现有效的领域自适应预训练
计算与语言
2023-07-17 v1 机器学习
摘要
我们提出了一种新颖的与任务无关的域内预训练方法,位于通用预训练与微调之间。我们的方法选择性地掩码域内关键词,即提供目标领域紧凑表示的词。我们使用KeyBERT (Grootendorst, 2020)识别此类关键词。我们使用六种不同设置评估我们的方法:三个数据集结合两个不同的预训练语言模型(PLM)。我们的结果显示,使用我们的域内预训练策略微调的PLM优于采用随机掩码域内预训练的PLM以及遵循常见预训练后微调范式的PLM。此外,识别域内关键词的开销是合理的,例如,对于BERT Large (Devlin et al., 2019),两个轮次的预训练时间为7-15%。
引用
@article{arxiv.2307.07160,
title = {Do not Mask Randomly: Effective Domain-adaptive Pre-training by Masking In-domain Keywords},
author = {Shahriar Golchin and Mihai Surdeanu and Nazgol Tavabi and Ata Kiapour},
journal= {arXiv preprint arXiv:2307.07160},
year = {2023}
}
备注
final version: accepted at ACL'23 RepL4NLP. arXiv admin note: text overlap with arXiv:2208.12367