中文

容量重要:基于真实世界数据的Transformer记忆力概念验证

计算与语言 2025-06-18 v1

摘要

本文研究模型架构和数据配置如何影响生成式Transformer的经验记忆容量。模型使用源自Systematized Nomenclature of Medicine(SNOMED)知识图的合成文本数据集进行训练:表示静态连接的三元组,模拟复杂关系模式的序列。结果表明,嵌入大小是学习速度和容量的主要决定因素,而额外的层数提供有限的益处且可能损害简单数据集上的性能。激活函数起关键作用,Softmax在稳定性和容量方面表现更好。此外,数据集的复杂度增加似乎会提高最终记忆能力。这些见解改善了我们对Transformer记忆机制的理解,为使用结构化真实世界数据优化模型设计提供了框架。

关键词

引用

@article{arxiv.2506.14704,
  title  = {Capacity Matters: a Proof-of-Concept for Transformer Memorization on Real-World Data},
  author = {Anton Changalidis and Aki Härmä},
  journal= {arXiv preprint arXiv:2506.14704},
  year   = {2025}
}

备注

This work has been accepted for publication at the First Workshop on Large Language Model Memorization (L2M2) at ACL 2025, Vienna, Austria