Vision-LSTM:将 xLSTM 应用于通用视觉骨干网络
计算机视觉与模式识别
2025-02-24 v3 人工智能
机器学习
摘要
变压器因最初用于自然语言处理而在计算机视觉中被广泛用作通用骨干网络。最近,长短期记忆网络 (LSTM) 被扩展为一种可扩展且性能优异的架构——xLSTM,通过指数门控和可并行化的矩阵记忆结构克服了长期以来的 LSTM 局限性。本报告介绍了 Vision-LSTM (ViL),即将 xLSTM 的构建模块应用于计算机视觉的 adaptation。ViL 由 xLSTM 块堆叠而成,其中奇数块从上到下处理 patch token 的序列,而偶数块则从下到上处理。实验表明,ViL 有潜力可进一步部署为计算机视觉架构的新型通用骨干网络。
引用
@article{arxiv.2406.04303,
title = {Vision-LSTM: xLSTM as Generic Vision Backbone},
author = {Benedikt Alkin and Maximilian Beck and Korbinian Pöppel and Sepp Hochreiter and Johannes Brandstetter},
journal= {arXiv preprint arXiv:2406.04303},
year = {2025}
}
备注
Published as a conference paper at ICLR 2025, Github: https://github.com/NX-AI/vision-lstm