中文

掩码语言模型在科学领域中的收益递减

计算与语言 2023-05-04 v2 机器学习

摘要

基于 Transformer 的掩码语言模型(如 BERT)在通用语料上训练后,在下游任务中展现出令人印象深刻的性能。已有研究表明,通过在更多数据上更长时间地预训练更大的模型,可以提升此类模型的下游任务性能。在本工作中,我们实证评估了这些结果在科学任务中的适用程度。我们使用 14 个领域特定的基于 Transformer 的模型(包括 ScholarBERT,一个在多达 225B tokens 上预训练的新 770M 参数、聚焦科学的掩码语言模型)来评估训练数据、模型规模、预训练与微调时间对 12 个下游科学任务的影响。有趣的是,我们发现增大模型规模、训练数据或计算时间并不总能在科学信息抽取任务中带来显著改进(即 >1% F1),即便有也未必,并针对这一令人惊讶的性能差异提供了可能的解释。

关键词

引用

@article{arxiv.2205.11342,
  title  = {The Diminishing Returns of Masked Language Models to Science},
  author = {Zhi Hong and Aswathy Ajith and Gregory Pauloski and Eamon Duede and Kyle Chard and Ian Foster},
  journal= {arXiv preprint arXiv:2205.11342},
  year   = {2023}
}

备注

12 pages. 3 figures. 5 tables. Accepted to the Findings of ACL 2023