ClimateBert:面向气候相关文本的预训练语言模型
计算与语言
2022-12-20 v3
摘要
近年来,大型预训练语言模型(LM)彻底改变了自然语言处理(NLP)领域。然而,尽管通用语言上的预训练对日常语言表现良好,但已观察到小众语言存在困难。特别是,气候相关文本包含通用 LM 无法准确表示的特定语言。我们认为,当今 LM 的这一缺陷限制了现代 NLP 在气候相关文本处理广阔领域的适用性。作为补救,我们提出 CLIMATEBERT,一种基于 transformer 的语言模型,其在从常见新闻、研究论文及企业气候报告等多种来源爬取的逾 200 万段气候相关文本上进一步预训练。我们发现 CLIMATEBERT 在掩码语言模型目标上带来 48% 的提升,进而使文本分类、情感分析与事实核查等多种气候相关下游任务的错误率降低 3.57% 至 35.71%。
引用
@article{arxiv.2110.12010,
title = {ClimateBert: A Pretrained Language Model for Climate-Related Text},
author = {Nicolas Webersinke and Mathias Kraus and Julia Anna Bingler and Markus Leippold},
journal= {arXiv preprint arXiv:2110.12010},
year = {2022}
}