Nautile-370M:谱内存遇注意力的小规模推理模型
机器学习
2026-04-29 v1 人工智能
摘要
我们提出 Nautile-370M,一个 3.7 亿参数的小型语言模型,旨在严格的参数和推理预算下实现高效推理。Nautile-370M 使用混合主干结构,其中两个 SeqCond Attention(SCA)层、一个线性时间谱序列算子受 SeqCondenser 启发,交替出现一个 transformer 层。此设计旨在保留结构化序列模型在长程上下文效率和状态跟踪方面的优势,同时保持注意力的表达性 token-to-token 路由。该模型在通过 Google TPU Research Cloud(TRC)计划提供的单个 Cloud TPU v4-64 切片上训练;随后的强化学习阶段在单个 NVIDIA DGX Spark 上完成。我们证明了 SCA 读取机制可以精确检索前缀摘要中的任何单个 token,并且可作为特殊情况复现 softmax 注意力的任何输出,确立了 SCA 在连续极限下至少与完整自注意力等价表达。我们还描述了训练数据管道并概述了一个专为推理、验证和响应质量设计的强化学习阶段。
引用
@article{arxiv.2604.24809,
title = {Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model},
author = {Maixent Chenebaux},
journal= {arXiv preprint arXiv:2604.24809},
year = {2026}
}