中文

BERT的时间自适应及其在下游文档分类上的表现:来自社交媒体的洞察

计算与语言 2021-09-09 v2

摘要

语言使用在不同领域之间存在差异,即便在同一领域内,语言使用也会随时间变化。对于BERT等预训练语言模型,通过持续预训练进行领域自适应已被证明可提升领域内下游任务的性能。在本文中,我们探究时间自适应是否能带来额外收益。为此,我们引入一个在三年内采样的社交媒体评论语料库。它包含用于自适应的无标注数据,以及用于上游掩码语言建模任务评估的数据,同时包含用于下游文档分类任务微调与评估的带标注数据。我们发现时间性对两项任务均重要:时间自适应改善了上游任务,时间微调改善了下游任务表现。特定时间模型在过去测试集上通常优于未来测试集,这与主题词突发性使用的证据相符。然而,将BERT同时自适应于时间和领域,并未比仅自适应于领域在下游任务上带来提升。词元级分析表明,时间自适应捕捉到了下游任务中语言使用的事件驱动变化,但并未捕捉到那些实际与任务表现相关的变化。基于我们的发现,我们讨论了时间自适应何时可能更为有效。

关键词

引用

@article{arxiv.2104.08116,
  title  = {Temporal Adaptation of BERT and Performance on Downstream Document Classification: Insights from Social Media},
  author = {Paul Röttger and Janet B. Pierrehumbert},
  journal= {arXiv preprint arXiv:2104.08116},
  year   = {2021}
}

备注

Accepted at EMNLP 2021 (Findings)