中文

时间被编码在微调语言模型的权重中

计算与语言 2024-01-02 v2

摘要

我们提出了时间向量,一种将语言模型定制到新时间段的简单工具。时间向量是通过在单一时间段(例如,某年或某月)的数据上微调语言模型,然后减去原始预训练模型的权重来创建的。该向量指定了权重空间中的一个方向,正如我们的实验所示,这能提升模型在该时间段文本上的性能。针对相邻时间段特化的时间向量在流形中似乎位置更近。利用这一结构,我们在时间向量之间进行插值以生成新模型,这些模型在中间时间段和未来时间段上表现更好,且无需任何额外训练。我们证明了我们的发现在不同任务、领域、模型规模和时间尺度上的一致性。我们的结果表明,时间被编码在微调模型的权重空间中。

关键词

引用

@article{arxiv.2312.13401,
  title  = {Time is Encoded in the Weights of Finetuned Language Models},
  author = {Kai Nylund and Suchin Gururangan and Noah A. Smith},
  journal= {arXiv preprint arXiv:2312.13401},
  year   = {2024}
}

备注

Added references to Jaidka et al. (2018) and Loureiro et al. (2022)