注意力就够了?直至需要记忆
机器学习
2025-01-17 v1 人工智能
摘要
本文引入了一种新的Retention Layer机制,用于Transformer架构,旨在解决其内在的记忆能力不足问题。与人类认知不同,生成式预训练Transformer仅依赖固定的预训练权重和暂时的上下文窗口,这限制了其适应性。所提出的Retention Layer集成了持久化记忆模块,具备实时数据填充、动态召回和引导性输出生成能力。该增强功能使模型能够存储、更新和复用跨会话中观察到的模式,实现增量学习,弥合静态预训练与动态情境适应之间的鸿沟。Retention Layer的设计类比于社会学习过程,包含注意力、记忆、再生产和动机四个阶段。技术上,它整合了记忆注意力机制和情景缓冲区,以管理记忆规模、缓解过拟合并确保高效召回。应用领域包括自适应个人助理、实时欺诈检测、自主机器人、内容审核及医疗诊断。在每个领域,记忆机制使系统能够增量学习、个性化输出并有效应对不断演变的现实挑战。通过模拟人类学习的关键方面,此类记忆增强型架构构建了更流畅、更具响应性的AI范式,为动态、会话感知模型铺路,使传统Transformer的能力扩展至需要持续适应的领域。
引用
@article{arxiv.2501.09166,
title = {Attention is All You Need Until You Need Retention},
author = {M. Murat Yaslioglu},
journal= {arXiv preprint arXiv:2501.09166},
year = {2025}
}