中文

规模化的记忆马赛克

人工智能 2026-01-15 v3

摘要

记忆马赛克[张等,2025]是由关联记忆网络组成,这类网络在中等规模网络(GPT-2规模)和合成小型数据集上表现出引人注目的组合性和类比学习能力。本文表明,这些有利特性在将记忆马赛克扩展至大型语言模型规模(llama-8B规模)和真实世界数据集时仍然保持。为此,我们将记忆马赛克扩展至100亿规模,训练其在1万亿标记上,我们引入若干架构修改("记忆马赛克v2"),并在三个评估维度上进行能力评估:训练知识存储、新知识存储和类比学习。在整个评估过程中,记忆马赛克v2在学习训练知识(第一个维度)上与变换器持平,并在在推断时完成新任务(第二个和第三个维度)方面显著优于变换器。这些改进不容易通过仅增加变换器的训练数据来复制。一个在1万亿标记上训练的记忆马赛克v2,在在八万亿标记上训练的变换器仍然在这些任务上表现更佳。

关键词

引用

@article{arxiv.2507.03285,
  title  = {Memory Mosaics at scale},
  author = {Jianyu Zhang and Léon Bottou},
  journal= {arXiv preprint arXiv:2507.03285},
  year   = {2026}
}

备注

Oral @ NeurIPS 2025