一种基于克尔-脉冲注意力的生成式预训练变换器
光学
2026-05-26 v1
摘要
人工智能系统,特别是通过生成式预训练变换器(GPT),已实现了功能丰富的语言模型,但其运行在数字计算、内存和数据移动方面存在较大的成本。注意力是GPT中的核心操作,计算输入标记的上下文依赖权重。由于深度学习模型是由非线性变换的组合定义的,识别能够实现这些模型的物理系统可为实现更高效率提供一条途径。本文介绍克尔-脉冲注意力,利用激励-耗尽非线性动力学中的谐振器来实现、执行和验证深度学习注意力操作的物理硬件。我们使用克尔-脉冲注意力响应训练变换器语言模型,并通过将模型产生的输入流式输入到实验系统中来探索生成推理。我们观察到实验产生的非线性权重与克尔-脉冲模型所预测的非线性权重之间高度一致。计算通过激励一组克尔脉冲的时序输入来进行,输入被编码为在非线性动力学下演化的时序信号。我们的ethods将记忆和计算映射到相同的物理动力学中,减轻了中间数字存储和数据移动的需求。这一工作指向了克尔脉冲在深度学习模型中提供物理记忆和高带宽流式非线性处理的混合数字-物理学习系统之路。
引用
@article{arxiv.2605.24124,
title = {A generative pre-trained transformer with Kerr-soliton attention},
author = {Lindell M. Williams and Yan Jin and Scott B. Papp},
journal= {arXiv preprint arXiv:2605.24124},
year = {2026}
}