中文

面向 Engram 式条件记忆的无碰撞热层扩展:训练动力学的受控研究

机器学习 2026-01-27 v2 人工智能 计算与语言

摘要

我们调查了高频 key 碰撞是否是 Engram 式条件记忆的主要瓶颈。为孤立碰撞效应,本文引入了无碰撞热层扩展,通过最小完美哈希函数 (MPHF) 映射最频繁的 n-gram,同时保留原始的多头哈希查找作为冷层。在严格等参数设置下,无碰撞设计不一致地改善验证损失。通过基于路由的分层评估(将 per-token 损失分解为热/冷贡献),我们发现训练期间存在一致的 "热到冷优势翻转":初始时热 (高频) 位置损失较低,但冷位置最终超过它们。关键的是,无碰撞配置的翻转发生得更早于碰撞易产生的基线,表明碰撞充当了隐式正则化。我们还识别出一种门控不匹配:门控学习在训练早期偏好热位置,但这种偏好在翻转后仍持续,将更高的权重分配给损失更高的位置。我们的发现表明,仅提高查找精度并不必然保证更好的训练结果。主要限制可能在于门控信用分配,而非索引精度,碰撞引起的噪声可能提供有益的正则化,不应被轻易消除。

关键词

引用

@article{arxiv.2601.16531,
  title  = {A Collision-Free Hot-Tier Extension for Engram-Style Conditional Memory: A Controlled Study of Training Dynamics},
  author = {Tao Lin},
  journal= {arXiv preprint arXiv:2601.16531},
  year   = {2026}
}