中文

Bag of Lies:持续预训练BERT的鲁棒性研究

计算与语言 2024-06-17 v1

摘要

本研究旨在获取关于BERT持续预训练阶段中实体知识的更多见解,以新冠疫情作为案例研究。由于疫情发生在BERT预训练数据最后一次更新之后,该模型对新冠疫情几乎没有实体知识。通过持续预训练,我们控制模型可获得的实体知识。我们将基线BERT模型与在事实查证基准(Check-COVID)上的进一步预训练版本进行比较。为测试持续预训练的鲁棒性,我们实验了几种对抗方法来操控输入数据,如在误导性信息上训练或随机化词序直至输入变得毫无意义。令人惊讶的是,我们的发现表明,这些方法不会降低模型的下游性能,甚至有时会提高模型的下游性能。这表明BERT的持续预训练对误导性信息具有鲁棒性。此外,我们正在发布一个新数据集,包含来自LitCovid存储库中原始学术出版物文本及其AI生成的虚假版本。

关键词

引用

@article{arxiv.2406.09967,
  title  = {Bag of Lies: Robustness in Continuous Pre-training BERT},
  author = {Ine Gevers and Walter Daelemans},
  journal= {arXiv preprint arXiv:2406.09967},
  year   = {2024}
}