中文

追踪预训练期间多语言事实知识的获取

计算与语言 2025-10-08 v2

摘要

大型语言模型(LLMs)能够recall(pretraining data中存在的多语言事实知识)。然而,大多数研究仅评估最终模型,导致在预训练期间事实recall和跨语言一致性的发展几乎未被探索。在本工作中,我们追踪了事实recall和跨语言一致性如何在预训练期间演化,聚焦于OLMo-7B作为案例研究。我们发现,对于大多数语言,准确率和一致性会随时间改善。我们表明,这一改进主要由预训练语料中事实的频率驱动:更频繁的事实更可能被正确recall,无论语言。然而,一些非英语语言中的低频事实仍可被正确recall。我们的分析表明,这些实例主要受益于其英文对应项的跨语言传递——这种效应在预训练的早期阶段主要出现。我们指出了获取多语言事实知识的两种 distinct 路径:(1) 频率驱动的学习,占主导地位且语言无关;(2) 跨语言传递,规模有限,通常仅限于涉及专有实体的关系类型。我们发布了代码和数据,以便进一步研究 https://github.com/cisnlp/multilingual-fact-tracing.

关键词

引用

@article{arxiv.2505.14824,
  title  = {Tracing Multilingual Factual Knowledge Acquisition in Pretraining},
  author = {Yihong Liu and Mingyang Wang and Amir Hossein Kargaran and Felicia Körner and Ercong Nie and Barbara Plank and François Yvon and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2505.14824},
  year   = {2025}
}

备注

EMNLP Findings 2025