规模化的记忆马赛克
人工智能
2026-01-15 v3
摘要
记忆马赛克[张等,2025]是由关联记忆网络组成,这类网络在中等规模网络(GPT-2规模)和合成小型数据集上表现出引人注目的组合性和类比学习能力。本文表明,这些有利特性在将记忆马赛克扩展至大型语言模型规模(llama-8B规模)和真实世界数据集时仍然保持。为此,我们将记忆马赛克扩展至100亿规模,训练其在1万亿标记上,我们引入若干架构修改("记忆马赛克v2"),并在三个评估维度上进行能力评估:训练知识存储、新知识存储和类比学习。在整个评估过程中,记忆马赛克v2在学习训练知识(第一个维度)上与变换器持平,并在在推断时完成新任务(第二个和第三个维度)方面显著优于变换器。这些改进不容易通过仅增加变换器的训练数据来复制。一个在1万亿标记上训练的记忆马赛克v2,在在八万亿标记上训练的变换器仍然在这些任务上表现更佳。
引用
@article{arxiv.2507.03285,
title = {Memory Mosaics at scale},
author = {Jianyu Zhang and Léon Bottou},
journal= {arXiv preprint arXiv:2507.03285},
year = {2026}
}
备注
Oral @ NeurIPS 2025