域内语料库规模对预训练 BERT 的影响
计算与语言
2022-12-16 v1
摘要
许多先前的语言建模工作表明,在域内语料库上预训练可显著提升下游特定领域 NLP 任务上的性能。然而,收集足够域内数据所关联的困难可能使研究者不愿着手此项预训练任务。在本文中,我们通过使用不同规模的生物医学语料库预训练 Bidirectional Encoder Representations from Transformers(BERT)进行了一系列实验。结果表明,以有限训练步数在相对少量的域内数据(4GB)上预训练,相比微调在通用语料库上预训练的模型,能在下游特定领域 NLP 任务上带来更优性能。
引用
@article{arxiv.2212.07914,
title = {The Effects of In-domain Corpus Size on pre-training BERT},
author = {Chris Sanchez and Zheyuan Zhang},
journal= {arXiv preprint arXiv:2212.07914},
year = {2022}
}
备注
6 pages