中文

通过语言模型系列理解科学的演化

计算与语言 2025-05-19 v2 计算机与社会 数字图书馆

摘要

我们引入了AnnualBERT,一系列专门设计用于捕捉科学文本时间演化的语言模型。与子词分词和“一个模型统治所有”的主流范式不同,AnnualBERT采用整词作为词元,并由一个在2008年前发表的170万篇arXiv论文全文上从头预训练的基础RoBERTa模型以及一组在arXiv论文上逐年渐进训练的模型组成。我们通过展示AnnualBERT模型不仅在标准任务中具有可比的性能,而且在特定领域的NLP任务以及arXiv引文网络中的链接预测任务上达到了最先进的性能,证明了其有效性。然后,我们利用探针任务来量化模型在时间推移过程中在表示学习和遗忘方面的行为。我们的方法使预训练模型不仅能够提高科学文本处理任务的性能,还能提供对科学话语随时间发展的洞察。该模型系列可在https://huggingface.co/jd445/AnnualBERTs获取。

关键词

引用

@article{arxiv.2409.09636,
  title  = {Towards understanding evolution of science through language model series},
  author = {Junjie Dong and Zhuoqi Lyu and Qing Ke},
  journal= {arXiv preprint arXiv:2409.09636},
  year   = {2025}
}