中文

CogScale:面向序列处理的可扩展基准

人工智能 2026-05-20 v1 数据库 机器学习

摘要

随时间推移维持和操作信息的能力是生物和人工智能的一个基本方面。尽管现代模型在自然语言处理等任务中取得了显著成功,但评估新型架构处理序列信息的能力仍然计算昂贵且耗时。测试一种新架构通常需要扩展到海量数据集和模型,导致巨大的计算成本和缓慢的迭代周期。在本文中,我们提出了 CogScale,一个包含 14 个可扩展合成任务的基准,旨在不同的可参数化规模下隔离和评估特定的认知和记忆能力。通过提供一个标准化的轻量级框架,CogScale 使研究人员能够在投入大规模训练之前快速验证架构创新。为了建立坚实的基线,我们评估了七种不同的架构:门控循环单元 (GRU)、长短期记忆网络 (LSTM)、xLSTM、回声状态网络 (ESN)、Mamba、Transformer 解码器和 Transformer 编码器-解码器。这些评估在严格的参数预算(1k、10k 和 100k)以及不同的难度级别和规模下进行。我们的结果表明,虽然经典 RNN 和回声状态网络在严格的参数预算下擅长基本的信息保持,但只有注意力机制和现代状态空间模型能在推理复杂度和任务难度增加时持续保持高性能。

关键词

引用

@article{arxiv.2605.19758,
  title  = {CogScale: Scalable Benchmark for Sequence Processing},
  author = {Yannis Bendi-Ouis and Romain de Coudenhove and Xavier Hinaut},
  journal= {arXiv preprint arXiv:2605.19758},
  year   = {2026}
}