中文

面向历时语言变迁发现的语言模型预训练

计算与语言 2026-03-31 v3

摘要

大型语言模型(LLM)已显示出作为科学发现工具的潜力。这引发了对其在人文学科领域(如历史语言学和文学研究)中的应用日益增长的兴趣。这些领域通常基于边界划分(如体裁)或更不灵活的时期构建论点。虽然已尝试通过微调或模型编辑来限制推理范围,但我们认为唯一的保证是领域受限的预训练——这通常是数据和计算密集型的命题。我们展示了高效预训练技术可以生产有用的模型,这些模型运行在太大难以进行人工检查却太小适合“典型”LLM 方法的语料库上。我们采用一种新颖的日期归因管道,以获得五个 1000 万词片段的时间分段数据集。我们训练两个相应的五模型电池,这些模型在这些语料库段上进行高效预训练和 Llama3-8B 参数高效微调。我们发现,预训练模型比微调基线更快训练,而且它们更好地尊重我们语料库的历史划分。强调速度和精度而非全面性,使我们能够在目标领域实现若干新方法的假设发现和测试。以历时语言学为测试台,我们表明我们的方法能够检测到包括大规模词汇变化、非词汇(语法和形态)变化以及词义引入/淘汰等多样化现象。我们提供了一个可立即使用的管道,允许仅通过最小程度的调整将该方法扩展到其他目标领域。

关键词

引用

@article{arxiv.2504.05523,
  title  = {Pretraining Language Models for Diachronic Linguistic Change Discovery},
  author = {Elisabeth Fittschen and Sabrina Li and Tom Lippincott and Leshem Choshen and Craig Messner},
  journal= {arXiv preprint arXiv:2504.05523},
  year   = {2026}
}

备注

Accepted to Findings of the EACL 2026