SeRpEnt:面向表达性状态空间模型的选择性重采样
机器学习
2025-01-22 v1 计算机视觉与模式识别
摘要
状态空间模型(SSM)最近在序列建模的深度学习领域崭露头角,尤其是作为Transformer的替代方案。它们的成功源于避免了基于注意力模型的两个众所周知的缺点:相对于序列长度的二次复杂度以及无法建模长程依赖。SSM变体Mamba在没有使用任何注意力形式的情况下展现了与Transformer相当的性能,这得益于对状态参数使用了选择性机制。然而,选择性仅通过经验评估,其有效性的原因仍不清楚。在这项工作中,我们展示了选择性如何与序列处理相关。我们的分析表明,Mamba中的选择性时间间隔充当信息的线性近似器。然后,我们提出了我们的SeRpEnt架构,这是一种SSM,它进一步利用选择性以信息感知的方式压缩序列。它采用了一种重采样机制,根据元素的信息内容聚合元素。我们在Long Range Arena基准和其他语言建模任务上的实证结果显示了SeRpEnt重采样机制的优势。
引用
@article{arxiv.2501.11729,
title = {SeRpEnt: Selective Resampling for Expressive State Space Models},
author = {Stefano Rando and Luca Romani and Matteo Migliarini and Luca Franco and Denis Gudovskiy and Fabio Galasso},
journal= {arXiv preprint arXiv:2501.11729},
year = {2025}
}
备注
19 pages, 3 figures