中文

面向任务切换的小型Transformer架构

机器学习 2025-08-07 v1 人工智能

摘要

大规模生成式AI的快速进展主要基于注意力机制。相反,要构思一种小规模应用,使得基于注意力的架构在性能上超过传统方法(如多层感知器或循环网络),则并不容易。在“任务切换”框架中,模型在持续的标记序列上工作,当前任务由随机插入的控制标记确定。我们展示了标准Transformer无法解决一个基于有限域算术的基本任务切换参考模型,其中包含专用于增量/加法/逆复制/上下文(IARC)的子任务。我们表明,Transformer、长短期记忆循环网络(LSTM)和普通多层感知器(MLP)实现了相似且仅略高于基准的预测准确率。我们将比较研究扩展至包括标准Transformer架构的非平移不变对应物——cisformer,以及另一种注意力机制——广义注意力。我们发现,后者的组合是唯一能够实现约95%显著性能水平的模型。我们的结果表明,在任务切换设置中,对比质量不同的表述可以更好地理解注意力的工作方式,甚至可以加以改进。

关键词

引用

@article{arxiv.2508.04461,
  title  = {Small transformer architectures for task switching},
  author = {Claudius Gros},
  journal= {arXiv preprint arXiv:2508.04461},
  year   = {2025}
}

备注

ICANN 2025, in press